眼科问题回答和推理使用OpenAI o1与其他大型语言模型
Sahana Srinivasan1,2, Xuguang Ai3, Minjie Zou1
1Centre for Innovation and Precision Eye Health, Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore, Singapore.
与GPT-4o和GPT-4相比,OpenAI的o1 LLM在眼科方面显示出高准确性,但在文本生成方面落后. 专家评价发现o1更有用和有组织,表明专门的LLM的潜力.
科学领域:
- 人工智能的人工智能
- 眼科医生 眼科 眼科
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于专门的医疗应用.
- 开放AI的o1法学士,具有专门的推理能力,需要在眼科进行评估.
- 一般的LLM推理可能对专业医疗领域不够,需要特定领域的模型.
研究的目的:
- 评估OpenAI的o1 LLM与其他领先的LLM的性能和推理能力,使用眼科特定的问题.
- 为了确定o1的一般推理能力是否符合专业医疗领域的要求.
- 为眼科领域特定LLM的发展和必要性提供信息.
主要方法:
- 六个LLM (o1,GPT-4o,GPT-4,GPT-3.5,Llama 3-8B,Gemini 1.5 Pro) 在MedMCQA数据集中的6990个眼科问题上进行了测试.
- 通过准确度和宏观F1得分来衡量性能.
- 使用文本生成指标 (ROUGE-L,BERTScore,BARTScore,AlignScore,METEOR) 和专家对有用性和组织性的定性评估来评估推理能力.
主要成果:
- LLM o1获得了最高的准确度 (0.877) 和宏观F1得分 (0.877).
- 在BERTScore和AlignScore指标中,GPT-4o和GPT-4的表现优于o1.
- o1在BARTScore和METEOR中表现出卓越的表现,专家评价认为其响应比GPT-4o更有用和有组织.
结论:
- OpenAI的o1 LLM在眼科问题的准确性方面表现出强的表现,但在文本生成质量方面表现出差异性.
- 虽然o1提供了有前途的临床实用性和组织性,但其表现表明,对于最佳的眼科应用,仍可能需要领域专业的LLM.
- 建议进行进一步的有针对性的评估,以充分了解专业医疗领域的LLM能力.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
09:27Using Eye Movements Recorded in the Visual World Paradigm to Explore the Online Processing of Spoken Language
Published on: October 13, 2018
相关概念视频
Improving Translational Accuracy
Observational Learning
Machines: Problem Solving II
Machines: Problem Solving I
The toggle clamp system is a machine structure consisting of movable, pin-connected multi-force members that form a stabilized system to transmit forces. The...
Reasoning
Inductive reasoning involves deriving generalizations from specific observations. This type of reasoning helps form beliefs about the world. For example,...
Language and Cognition
