视觉转换器:基于深度学习的眼科图像分析的下一个前沿.
Jo-Hsuan Wu1, Neslihan D Koseoglu2, Craig Jones2,3,4
1Department of Ophthalmology, Shiley Eye Institute and Viterbi Family, University of California, San Diego, La Jolla, CA, USA.
概括
视觉转换器 (ViT) 在眼科图像分析中表现出强的表现,用于糖尿病视网膜病变和青光瘤检测. 虽然潜在地优于卷积神经网络 (CNN),但由于更高的数据要求,它们的广泛采用面临着挑战.
科学领域:
- 眼科医生 眼科 眼科
- 医疗成像医学成像
- 人工智能的人工智能
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 深度学习,特别是卷积神经网络 (CNN),是眼科图像分析的标准.
- 视觉转换器 (ViTs) 正在成为一种强大的替代方案,可能超越CNN的能力.
- 眼科中ViT的比较性能和采用需要专注的研究.
研究的目的:
- 审查应用基于ViT的模型用于眼科图像分析的研究.
- 评估ViTs在糖尿病视网膜病变分级和青光眼检测等任务中的表现.
- 为了比较ViT的性能与传统的CNN在这个领域的方法.
主要方法:
- 在PubMed和谷歌学者数据库的系统文献搜索.
- 包括到2023年3月发表的原始调查.
- 专注于使用ViT模型进行彩色底部照片和光学连贯性断层扫描 (OCT) 图像分析的研究.
主要成果:
- 基于ViT的模型在分级糖尿病视网膜病变和检测玻璃眼瘤方面表现强.
- 一些研究表明,在特定的眼科图像分析背景下,ViT优于CNN.
- 与CNN相比,ViT通常需要更广泛的培训数据,这构成了潜在的采用障碍.
结论:
- ViT型号显示出对推进眼科图像分析的重大承诺,提供竞争力或优越的性能.
- 临床采用ViTs可能会因其数据密集型培训要求而受到限制.
- 需要进一步的研究才能充分理解ViT在眼科诊断中的长期影响和整合.


