在现实世界视网膜病例中,GPT-4.o,Claude 3.7和Gemini 2.5的多模式诊断准确性
Iden Amiri1, Cheng Jiao1, Alice Yang Zhang1
1Department of Ophthalmology, University of North Carolina-Chapel Hill, USA.
Journal of vitreoretinal diseases
|March 9, 2026
概括
在视网膜病例中,GPT-4.o和克劳德3.7索尼特显示出强大的诊断准确性,GPT-4.o在完整的临床环境中表现出色,克劳德3.7索尼特仅在图像分析中表现出色. 双子 2.5 Pro表现较差,强调需要在眼科中仔细选择人工智能模型.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床应用.
- 评估高级LLM在眼科等专业医疗领域的诊断能力至关重要.
研究的目的:
- 在现实世界视网膜病例中评估GPT-4.o,Claude 3.7 Sonnet和Gemini 2.5 Pro的诊断准确性.
- 在完全临床背景条件下比较AI性能与仅图像数据.
主要方法:
- 来自爱荷华大学EyeRounds存储库的40个视网膜病例被使用.
- 人工智能模型用完整的临床背景 (病史,检查,图像描述) 和仅图像数据进行了测试.
- 绩效指标包括诊断准确度,标志/症状识别,差异诊断和治疗建议.
主要成果:
- 在全文案例中,GPT-4.o获得了最高准确率 (78.4%),其次是Claude 3.7 Sonnet (73.0%).
- 克劳德3.7索内特在仅图像的情况下优越 (73.7%),超过了GPT-4.o (63.2%).
- 无论是GPT-4.o还是Claude 3.7 Sonnet,在两种情况的准确性,差异诊断和治疗建议方面都显著超过了Gemini 2.5 Pro.
结论:
- 在眼科中,GPT-4.o和Claude 3.7 Sonnet表现出强大的诊断和临床推理能力.
- 克劳德3.7索内特在基于图像的视网膜分析方面表现出色,而GPT-4.o在综合性临床信息方面表现更好.
- 双子 2.5 Pro 的性能较低凸显了对临床使用人工智能工具的仔细选择的关键需求.


