眼科大语言模型的标准化 (BELO):专家策划的数据集和知识和推理的评估框架
Sahana Srinivasan1,2, Xuguang Ai3, Thaddaeus Wai Soon Lo4
1Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore, Singapore.
Ophthalmology science
|February 16, 2026
概括
一个新的基准,眼科LLM的BEnchmarking (BELO),评估眼科大语言模型 (LLMs) 的知识和推理. 在高质量专家评价中,GPT-5显示出最高的准确性,而GPT-4o和Gemini 1.5 Pro在质量专家评价中表现出色.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 目前眼科的大型语言模型 (LLM) 的基准是有限的,主要关注准确性.
- 需要进行全面的评估,评估知识回忆和推理能力.
研究的目的:
- 引入BENchmarking LLMs for Ophthalmology (BELO),用于评估眼科LLM的标准化,专家验证的基准标准.
- 评估各种LLM在眼科相关知识和推理任务上的表现.
主要方法:
- 通过13名眼科医生的多轮专家审查,开发了BELO.
- 从各种医疗数据集中策划了900个眼科特定的多选择题.
- 通过使用定量指标 (准确性,宏观F1) 和定性专家评估,评估了8个LLM.
主要成果:
- 在精度 (0.90) 和宏观F1 (0.91) 方面,GPT-5获得了最高的定量分数.
- 专家的定性评估显示,GPT-4o在准确性和可读性方面获得了最高评级,而Gemini 1.5 Pro在完整性方面获得了最高评级.
- 在文本生成指标上LLM的表现表明临床推理有改进的空间.
结论:
- 贝洛为评估眼科LLM提供了一个强大的,临床相关的基准.
- 该基准评估了现有和新兴LLM的准确性和推理能力.
- 未来的代将包括基于视觉的质量保证和临床场景管理.

