相关实验视频
Updated: May 6, 2026

09:17
Using Retinal Imaging to Study Dementia
Published on: November 6, 2017
21.6K
黄金标准标签错误对深度学习模型在糖尿病视网膜病症查中的性能评估的影响:全国真实世界验证研究
Yueye Wang1,2, Xiaotong Han1, Cong Li1
1State Key Laboratory of Ophthalmology, Zhongshan Ophthalmic Center, Sun Yat-sen University, Guangdong Provincial Key Laboratory of Ophthalmology and Visual Science, Guangdong Provincial Clinical Research Center for Ocular Diseases, Guangzhou, China.
Journal of medical Internet research
|August 14, 2024
概括
糖尿病视网膜病变 (DR) 查中的人类标签错误显著影响人工智能 (AI) 绩效评估. 在全国范围的程序中纠正这些错误使深度学习算法的灵敏度提高了12.5%.
科学领域:
- 医疗人工智能 医疗人工智能
- 眼科医生 眼科 眼科
- 医疗成像医学成像
背景情况:
- 人类专家标签是培训和验证医疗AI的黄金标准.
- 标签可以作为比较AI模型预测的基准.
研究的目的:
- 评估深度学习 (DL) 算法的对糖尿病视网膜病变 (DR) 的分类准确性.
- 在全国DR选计划中证明标签错误对绩效评估的影响.
主要方法:
- 通过手动分级和DL算法,分析了来自全国DR选计划的基底照片.
- 被判定的图像与不同意的蒙面眼科医生来评估标签准确性.
- 根据裁定错误和重新评估DL算法性能,纠正了标签.
主要成果:
- 包括来自237,824名参与者的736,083张图像.
- 经过校正的标签显示DL算法灵敏度增加了12.5%,特异性增加了6.9%.
- 确定高近视和激光斑点是标签错误的常见原因.
结论:
- 很少的人类标签错误的百分比可以显著影响DL算法在现实世界DR查中的性能评估.
- 准确的标签对于医疗诊断中可靠的AI评估至关重要.

