视觉转换器和卷积神经网络的多数据集比较,用于从 Fundus 照片中检测光眼神经病变
Elizabeth E Hwang1,2, Dake Chen1, Ying Han1
1Department of Ophthalmology, University of California, San Francisco, San Francisco, CA 94143, USA.
Bioengineering (Basel, Switzerland)
|November 25, 2023
概括
与卷积神经网络 (CNN) 相比,视觉转换器 (ViT) 模型在从 fundus 图像中检测光眼神经病变 (GON) 中表现出优异的性能,特别是在不平衡的数据集中. 这一进步有助于预防与青光眼相关的失明.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 玻璃眼光神经病 (GON) 诊断依赖于 fundus 摄影,但早期检测仍然具有挑战性.
- 眼科疾病的自动查使用深度学习,但CNN和ViT模型之间的比较有限.
- 玻璃眼是全球不可逆转失明的主要原因,需要改进的诊断工具.
研究的目的:
- 为了比较视觉变压器 (ViT) 和卷积神经网络 (CNN) 模型在使用 fundus 照片检测 GON 的性能.
- 在不同的临床环境中确定ViT和CNN模型的优缺点.
- 评估ViT和CNN模型在多个数据集中的通用性.
主要方法:
- 在六个不同的,公开可用的 fundus 图像数据集上训练了可比的 ViT 和 CNN 模型.
- 使用标准指标评估模型性能:曲线下的面积 (AUC),灵敏度和特异性.
- 进行了ViT和CNN架构的并排比较.
主要成果:
- 在GON检测方面,ViT模型通常优于类似训练有素的CNN模型.
- ViT模型表现出卓越的性能,特别是当数据集过度代表了非光眼图像时.
- 在不同的数据集中观察到性能变化,突出显示了模型通用性的重要性.
结论:
- ViT模型为从 fundus 图像中准确且可扩展的 GON 检测提供了有希望的进步.
- 这些发现表明,ViT有潜力改善早期查和预防与玻璃眼相关的失明.
- 进一步的研究应该探索ViT在各种眼科环境中的临床实用性.


