数据泄露在深度学习中用于阿尔茨海默病诊断:对方法严谨性和性能通胀的全面审查
Vanessa M Young1,2, Samantha Gates1, Layla Y Garcia1
1Glenn Biggs Institute for Alzheimer's and Neurodegenerative Diseases, University of Texas Health Science at San Antonio, San Antonio, TX 78229, USA.
Diagnostics (Basel, Switzerland)
|September 27, 2025
概括
对于阿尔茨海默病诊断的深度学习通常会因为数据泄露而夸大准确性. 严格的验证显示,真正的性能为66-90%,与当前的方法相比,而不是革命性的.
科学领域:
- 医疗成像医学成像
- 人工智能在医学中的应用
- 神经科学是一个神经科学.
背景情况:
- 对于阿尔茨海默病 (AD) 诊断的深度学习模型经常报告高准确率 (>95%),但在临床翻译方面面临挑战.
- 方法上的缺陷,特别是数据泄露,可能会使性能指标膨胀,阻碍现实应用.
- 本综述审查了影响AD深度学习工具临床准备性的验证实践.
研究的目的:
- 调查方法缺陷,特别是数据泄露对AD诊断深度学习模型报告准确性的影响.
- 评估验证实践的现状及其对这些模型临床准备程度的影响.
- 确定关键挑战,并提出解决方案,以提高AD诊断中深度学习的可靠性.
主要方法:
- 根据PRISMA-ScR指南进行了范围审查,该协议在OSF上预先注册.
- 在PubMed,Scopus和CINAHL数据库中进行了搜索,直到2025年5月,用于AD诊断的深度学习研究.
- 开发了一个新的三层风险分层框架,以评估数据泄露的可能性,并系统地提取验证,可解释性和性能数据.
主要成果:
- 在包括的44项研究中,有90.9%的研究在2020-2023年期间发表. 在方法严谨性和报告准确性之间观察到显著的反向关系.
- 根据对象分类数据的研究报告了66-90%的准确性,而高数据泄露风险研究则声称95-99%. 在一项研究中,正确的验证导致准确度下降28个百分点.
- 只有15.9%的研究进行了外部验证,79.5%的研究未能对混因素进行控制,并且解释性方法的临床验证基本上不存在. 高风险的方法在最近几年显著下降.
结论:
- 数据泄露和方法上的缺陷造成了对AD诊断中深度学习的表现的夸张看法.
- 在AD诊断中深度学习的正确验证的真准确率在66-90%,与现有的临床方法相比,而不是革命性的.
- 应对挑战需要采用"方法三位一体":适当的数据分割,外部验证和混控制以确保临床准备.
更多相关视频
12:50Lesion Explorer: A Video-guided, Standardized Protocol for Accurate and Reliable MRI-derived Volumetrics in Alzheimer's Disease and Normal Elderly
Published on: April 14, 2014
40.8K
09:38Generalized Psychophysiological Interaction PPI Analysis of Memory Related Connectivity in Individuals at Genetic Risk for Alzheimer's Disease
Published on: November 14, 2017
15.6K
