对视觉转换器和常规卷积神经网络进行比较分析,以检测可推的糖尿病视网膜病变
Jocelyn Hui Lin Goh1, Elroy Ang2, Sahana Srinivasan1
1Singapore Eye Research Institute, Singapore National Eye Center, Singapore, Singapore.
Ophthalmology science
|August 21, 2024
概括
视觉转换器 (ViT) 在检测可转移的糖尿病视网膜病变 (DR) 方面明显优于卷积神经网络 (CNN). SWIN变压器模型在从视网膜图像中识别DR方面表现出卓越的性能.
科学领域:
- 眼科医生 眼科 眼科
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 从视网膜图像中检测糖尿病视网膜病变 (DR) 对于预防视力损失至关重要.
- 卷积神经网络 (CNN) 主导了图像分类任务,包括DR检测.
- 视觉变压器 (ViT) 是有前途的,但它们在可引用的DR检测中的有效性仍未得到充分研究.
研究的目的:
- 为了比较视觉变换器 (ViT) 和卷积神经网络 (CNN) 的性能,用于可指导的糖尿病视网膜病变 (DR) 检测.
- 用视网膜照片评估不同ViT和CNN模型的诊断准确性.
主要方法:
- 这是一项回顾性研究,涉及Kaggle,Messidor-1和SEED数据集中的48,269张视网膜图像.
- 开发和比较5个CNN模型和4个ViT模型用于可引用的DR检测.
- 使用操作特征曲线下的面积 (AUC),特异性和灵敏度对内部和外部测试集进行性能评估.
主要成果:
- SWIN变压器 (ViT型) 实现了最高的AUC (95.7%内部,97.3%SEED,96.3%Messidor-1),显著超过了所有CNN型号.
- 在80%的特异性下,SWIN变压器表现出高于CNN (76.3%-83.8%) 的灵敏度 (94.4%).
- 这些性能优势在内部和外部验证数据集中一致.
结论:
- 视觉转换器 (ViT) 与CNN相比,在从视网膜图像中检测可引用的糖尿病视网膜病变方面提供了更高的性能.
- ViT模型,特别是SWIN变压器,对于增强基于深度学习的DR检测系统具有重大潜力.
- 这些发现表明,ViTs可以优化视网膜照片的自动分析,以改善DR查和管理.


