开放AI o1大语言模型在眼科委员会样式问题上表现优于GPT-4o,Gemini 1.5 Flash和人类考生
Ryan Shean1, Tathya Shah1, Sina Sobhani1
1Keck School of Medicine, University of Southern California, Los Angeles, California.
Ophthalmology science
|July 21, 2025
概括
在眼科板式问题上,OpenAI o1表现优异,明显优于GPT-4o,双子座和人类测试对象. 这突显了AI在医学教育和实践中的进步.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 在医学知识评估中评估人工智能 (AI) 的表现至关重要.
- 将人工智能模型与眼科等专业领域的人类专业知识进行比较是一个新兴的研究领域.
研究的目的:
- 为了比较OpenAI o1,ChatGPT-4o和Gemini 1.5 Flash与人类测试对象在眼科董事会样式问题上的准确性.
- 通过眼科子专业和认知复杂度分层分析AI性能.
主要方法:
- 这是一项横截面研究,利用来自基础和临床科学课程 (BCSC) 和EyeQuiz问题库的500个眼科板式问题.
- 三个大型语言模型 (LLM) 被提示回答问题,分析了跨子专业和认知复杂度水平 (巴克沃尔特分类方案) 的性能.
- 使用统计分析,包括ANOVA和McNemar测试,来比较准确率.
主要成果:
- OpenAI o1获得了最高的整体精度 (84.6%),明显超过了GPT-4o (66.2%) 和Gemini 1.5 Flash (60.2%).
- 与其他AI模型相比,OpenAI o1在BCSC (91.2%) 和EyeQuiz (78.0%) 两个问题集上也表现出了优异的表现.
- 人类测试者表现 (64.5%的BCSC问题) 低于所有评估的AI模型,OpenAI o1在所有子专业和复杂度水平上都表现出色.
结论:
- 在眼科知识评估中,OpenAI o1与GPT-4o,Gemini和人类受试者相比表现优越.
- 这些发现强调了人工智能能力的快速发展以及OpenAI o1作为眼科教育和临床实践中补充工具的潜力.
更多相关视频
04:48Application of Deep Learning-Based Medical Image Segmentation via Orbital Computed Tomography
Published on: November 30, 2022
2.9K
13:12Translational Brain Mapping at the University of Rochester Medical Center: Preserving the Mind Through Personalized Brain Mapping
Published on: August 12, 2019
45.8K
