大型语言模型和顶级十级医生的表现在本科眼科考试中
Oluwaseun Akinniranye1, Olusegun Akinniranye2
1Ophthalmology, Princess Alexandra Hospital, Harlow, GBR.
Cureus
|December 26, 2025
概括
大型语言模型 (LLM) 在具有挑战性的考试中表现得与专家眼科医生相当. 克劳德·索内特4显著超过了医生,突出了LLMs在医学教育和实践中的潜力.
科学领域:
- 人工智能在医学中的应用
- 眼科 眼科研究 眼科研究
- 医疗教育 技术 技术 医学教育
背景情况:
- 人工智能 (AI) 和大型语言模型 (LLM) 越来越多地被用于医疗领域.
- 现有的研究表明,人工智能在医学考试中的熟练程度很高,但在专业测试中与人类专家的直接比较是有限的.
研究的目的:
- 为了比较领先的LLMs与顶级人类专家在一个困难的眼科检查上的表现.
- 在特定领域的医疗环境中评估AI的能力.
主要方法:
- 四个LLM (ChatGPT-5,Claude Sonnet 4,Gemini Pro,Perplexity) 被测试在三个高得分的眼科住院医生身上.
- 进行了100项多项选择题考试,反映了杜克长者本科奖学金考试.
- 统计分析包括独立样本t测试和单向ANOVA与Tukey的HSD后期测试.
主要成果:
- 聚合的LLM成绩 (平均85.50%) 在统计学上与聚合的医生相似 (平均75.67%;p=0.0533).
- 克劳德·索内特4 (91.00%) 在二次分析中显著超过了合并的医生队列 (p=0.0268).
- 在LLM和医生之间的光学子部分中,没有发现任何显著的差异.
结论:
- 像克劳德·索内特4这样的高级法学士可以与眼科考试中的高成绩医生的表现相匹配或超过.
- 作为眼科教育工具,LLM显著有前途.
- 与临床标准相对应的LLM的持续验证和维持人类监督至关重要.


