视力变压器带有蒙面自编码器,用于基于大尺寸视网膜图像的可参考糖尿病视网膜病变分类
Yaoming Yang1, Zhili Cai1, Shuxia Qiu1,2
1College of Science, China Jiliang University, Hangzhou, Zhejiang, China.
PloS one
|March 6, 2024
概括
这项研究引入了一种使用视觉变压器 (ViT) 和蒙面自编码器 (MAE) 的新深度学习模型,以更快地诊断糖尿病视网膜病变 (DR). 经过MAE预训练的ViT模型在从视网膜图像中分类可引用的DR方面取得了高准确性.
科学领域:
- 眼科医生 眼科 眼科
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 糖尿病视网膜病变 (DR) 诊断可以使用基于深度学习的计算机辅助诊断系统来加速.
- 变压器在图像分析中表现有前途,在自然图像上表现优于传统的卷积神经网络 (CNN).
研究的目的:
- 开发和评估一种新的深度学习模型,用于对可转移性糖尿病视网膜病变 (DR) 进行分类.
- 利用视觉转换器 (ViT) 架构与蒙面自动编码器 (MAE) 结合,以提高DR分类性能,使用有限的视网膜图像数据集.
主要方法:
- 一个视觉转换器 (ViT) 模型在100,000多个大尺寸的 fundus视网膜图像上使用面具自编码器 (MAE) 进行了预训练.
- 然后将MAE预训练的ViT应用于分类可引用的DR,并将其性能与在ImageNet上预训练的ViT模型进行比较.
主要成果:
- 对视网膜图像的MAE预培训策略显著超过了DR分类的ImageNet预培训.
- 开发的模型实现了高性能指标:93.42%的准确性,0.9853AUC,0.973最高灵敏度和0.9539最高特异性.
结论:
- 蒙面自动编码器 (MAE) 提供了灵活性,并减少了训练医学成像中的深度学习模型所需的图像数量.
- 这种方法证明了基于MAE的ViT预训练在DR检测中的有效性,而不需要ImageNet预训练的权重或广泛的数据集.


