领先的大型语言模型的高级分析,用于视网膜成像中的诊断准确性
Matteo Mario Carlà1,2, Emanuele Crincoli2,3, Fiammetta Catania4
1Ophthalmology Department, Fondation Adolphe de Rothschild, Paris, France mm.carla94@gmail.com.
The British journal of ophthalmology
|January 14, 2026
概括
先进的大型语言模型 (LLM) 在解释眼科底部图像方面表现有前途,但目前的能力有限. GPT-4.5 和 Gemini 2.0 Pro 显示出最高的诊断准确度,尽管罕见和复杂的疾病仍然存在挑战.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学图像解释.
- 眼科底部图像带来了复杂的诊断挑战.
研究的目的:
- 评估和比较八个领先的多式联络LLM在解读眼科底部图像的诊断能力.
- 为了评估跨多种眼病理的LLM绩效.
主要方法:
- 八个先进的多式联络LLM在100个不同的眼科底部图像上进行了测试.
- 绩效指标包括诊断准确性,特异性,敏感性,一致性,相关性和解释质量.
主要成果:
- GPT-4.5实现了最高的诊断准确率 (65.0%),紧随其后的是双子座2.0 Pro (63.0%).
- 最准确地确定了质性病理,而近视性黄斑病则证明具有挑战性 (平均准确率为21.8%).
- 性能较差的模型表现出显著的准确性缺陷和更高的诊断拒绝率.
结论:
- 目前的LLM为眼科底部图像提供了有希望但有限的诊断支持.
- 虽然对常见疾病有效,但LLM与罕见疾病和复杂的血管疾病作斗争.
- 像GPT-4.5和Gemini 2.0 Pro这样的高性能模型的互补优势可能会增强未来的诊断工具.


