基础模型与医生在文本和多式眼科问题的表现
Henry Rocha1, Yu Jeat Chong2, Arun James Thirunavukarasu3,4
1University of Cambridge School of Clinical Medicine, University of Cambridge, Cambridge, United Kingdom.
JAMA ophthalmology
|November 13, 2025
概括
基础模型 (FMs) 在眼科基于文本问题的表现强,匹配专家眼科医生. 然而,它们解释像图像一样的多式联络数据的能力仍然有限,需要进一步开发用于临床用途.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 对眼科临床知识和推理的大型语言模型 (LLM) 的兴趣日益增长.
- 对眼科LLM的多式联络能力的研究有限,特别是图像和表解释.
- 需要在眼科检查背景下评估先进的基础模型 (FMs).
研究的目的:
- 评估七个领先的基础模型 (FMs) 在回答眼科检查问题时的多式联络性能.
- 为了比较眼科医生和医生对眼科的表现.
- 评估文字和多模式问答能力.
主要方法:
- 使用皇家眼科医生学院学术奖学金第二部分的横截面研究书面考试准备材料.
- 七个基础模型 (GPT-4o,Gemini 1.5 Pro,克劳德 3.5 索内特,拉玛-3.2-11B,DeepSeek V3,Qwen2.5-Max,Qwen2.5-VL-72B) 进行了评估.
- 通过与教科书答案相比的准确度来衡量表现,与人类医生进行对比.
主要成果:
- 对于文本问题,Claude 3.5 Sonnet获得了最高的准确率 (77.7%),超过了实习生和初级医生,与专家眼科医生相美.
- 在文本问题上,GPT-4o表现强 (69.9%),超过了GPT-4和GPT-3.5.5等较旧的LLM.
- 对于多模式问题,GPT-4o (57.5%) 的表现优于其他FM,但不如专家眼科医生和实习生准确.
结论:
- 目前的眼科医生在眼科知识方面的显著改善,对文本查询进行推理,与专家眼科医生相比.
- 眼科医生显示出对文字眼科问题的医疗助理的潜力.
- 目前眼科FM的多模式功能仍然有限,需要进一步研究和微调各种眼科数据.


