在真实世界的临床数据上验证眼科人工智能模型的通用性
Homa Rashidisabet1,2, Abhishek Sethi2,3, Ponpawee Jindarak3
1Department of Biomedical Engineering, University of Illinois Chicago, Chicago, IL, USA.
Translational vision science & technology
|November 3, 2023
概括
在公共基底图像上训练的深度学习模型难以将其推广到真实世界的数据,以诊断青光眼. 现实世界的数据是改善这些模型用于临床使用的关键.
科学领域:
- 眼科医生 眼科 眼科
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 深度学习 (DL) 模型对使用 fundus 图像诊断眼睛疾病,如玻璃眼病,显示出前景.
- 然而,在公共数据集上训练的模型可能在现实世界的临床数据上表现不佳,原因是图像采集和患者群体的变化.
研究的目的:
- 评估在公共基金图像数据集上训练的深度学习模型的通用性,当它们被应用于用于青光眼诊断的现实数据时.
- 为了比较在公共与现实世界数据上训练的模型的性能,用于格劳科马分类和光盘细分.
主要方法:
- 利用了六个公共基金图像数据集和一个现实世界数据集 (伊利诺伊州眼睛和耳朵医院).
- 在公开和现实数据集上训练并测试了对玻璃眼的分类和光盘细分的深度学习模型.
- 分析了模型决策过程和学习的嵌入点,用于格劳科马分类.
主要成果:
- 公开训练的模型在公开测试数据上表现更好 (95.0%的AUC用于分类,96.3%的IOU用于细分).
- 在真实世界测试数据 (76.6% AUC, 85.6% IoU) 上,公开训练的模型的性能显著下降.
- 与公开训练的模型相比,在真实世界数据上训练的模型在真实世界测试集上表现出更好的表现.
结论:
- 在公共 fundus 图像上训练的深度学习模型在现实环境中对眼病诊断具有有限的概括性.
- 现实世界的数据对于提高深度学习模型的概括性和促进其在眼科中的临床转化至关重要.


