在视网膜OCT分析的多式模式中利用视觉转换器.
Georgios Feretzakis1, Christina Karakosta2, Aris Gkoulalas-Divanis3
1School of Science and Technology, Hellenic Open University, Patras, Greece.
Studies in health technology and informatics
|May 17, 2025
概括
深度学习模型,包括视觉转换器 (ViTs),通过光学连贯断层扫描 (OCT) 图像准确地分类视网膜疾病. 将患者元数据与成像数据集成,可以提高AMD和DME等疾病的诊断性能.
科学领域:
- 眼科医生 眼科 眼科
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 光学连贯断层扫描 (OCT) 提供高分辨率的视网膜成像,对于诊断眼睛疾病至关重要.
- 准确的OCT图像分类有助于识别诸如与年龄相关的黄斑退化 (AMD) 和糖尿病黄斑 (DME) 等疾病.
研究的目的:
- 评估深度学习模型 (CNNs,ViTs) 在对海外国家和地区图像进行分类方面的有效性.
- 评估将患者元数据纳入OCT图像分类中的影响,即使缺少数据.
主要方法:
- 各种深度学习架构的比较,包括卷积神经网络 (CNN) 和视觉转换器 (ViT).
- 开发和评估整合OCT图像与患者元数据 (年龄,性别,眼睛横向性,年龄) 的多式模式.
主要成果:
- 密集网121和多式联网网18实现了最高的精度 (95.16%).
- 在DenseNet121中,F1得分比F1得分高 (0.9313).
- 一个基于ViT的多式联机模型达到93.22%的准确性,展示了ViT在多式联机医疗数据分析中的潜力.
结论:
- 集成OCT图像和元数据的多模式深度学习模型显示出具有竞争力的诊断性能.
- 视觉转换器 (ViT) 显示出复杂的多式联络医疗图像分析的前景,特别是在眼科中.


