在光学和折射手术中对大型语言模型进行比较评估:对多选项问题的表现
Leah Attal1,2, Elad Shvartz1,3, Alon Gorenshtein1,4,5
1Azrieli Faculty of Medicine, Bar Ilan University, Ramat-Gan 5290002, Israel.
Vision (Basel, Switzerland)
|October 24, 2025
概括
在眼科认证考试中测试了七种先进的AI大语言模型 (LLM). 聊天GPT O1在整体和计算方面表现出色,而DeepSeek V3和ChatGPT O3 Mini分别在折射手术和图像分析方面领先.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 大型语言模型 (LLM) 在各种领域显示出前景.
- 评估LLM在眼科等专业医疗领域的表现至关重要.
- 了解LLM能力可以告知他们融入医疗培训.
研究的目的:
- 评估七个先进的AI大语言模型 (LLM) 在光学和折射手术的多选择题 (MCQ) 的准确性.
- 根据问题类型 (计算,子专业,基于图像) 来比较LLM的表现.
- 探索LLMs在眼科实习教育中的潜在作用.
主要方法:
- 七个LLM (ChatGPT 4o,ChatGPT O3 Mini,ChatGPT O1,DeepSeek V3,DeepSeek R1,Gemini 2.0 Flash,Grok-3) 进行了测试.这些LLM的使用情况包括:
- 使用了来自国家眼科认证考试的134个公开的MCQ.
- 准确性经过统计分析,并通过模型和问题类别进行了比较.
主要成果:
- 聊天GPT O1获得了最高的整体精度 (83.5%),在光学计算 (84.1%) 和光学问题 (82.4%) 中表现出色.
- 在折射手术问题上,DeepSeek V3 (89.7%) 和ChatGPT O3 Mini (88.4%) 的准确度更高.
- 在图像分析方面,ChatGPT O3 Mini领先 (88.2%),而ChatGPT O1在计算和非计算问题上表现出一致的准确性.
结论:
- 高级LLM在眼科MCQ中表现出高精度,包括复杂的计算和视觉项目.
- 在眼科中,LLM显示出考试准备和医疗培训的潜力.
- 需要对更大,多语言数据集进行进一步的研究,以证实和扩展这些研究结果的教育应用.


