GPT-4o和OpenAI o1 关于2024年西班牙竞争性医疗专业准入考试的表现:跨部门定量评估研究
Pau Benito1, Mikel Isla-Jover2, Pablo González-Castro3
1Department of Preventive Medicine and Epidemiology, Clinical Institute of Medicine and Dermatology (ICMiD), Hospital Clínic de Barcelona, Rosselló, 138, ground floor, Barcelona, 08036, Spain, 34 932 27 54 00 ext 4046.
JMIR medical education
|January 12, 2026
概括
生成型人工智能模型GPT-4o和OpenAI o1在西班牙医疗执照考试 (MIR 2024) 中显示出高准确度,表现优于平均候选人. 这些大型语言模型显示了改变医学教育和考试准备的潜力.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 自然语言处理自然语言处理.
背景情况:
- 生成型人工智能 (AI) 和大型语言模型 (LLM) 正在迅速发展.
- 士课程显示了改变医学教育的巨大潜力.
- 之前的研究已经评估了聊天机器人的医疗检查性能.
研究的目的:
- 评估GPT-4o和OpenAI o1在2024年内科医生 (MIR) 考试中的表现.
- 在全国医学考试中,将LLM成绩与医学专家和平均候选人进行比较.
- 分析各种医学科目的LLM绩效,并询问难度.
主要方法:
- 分析了MIR 2024考试中的176个问题.
- 每个问题都单独提交给GPT-4o和OpenAI o1,以确保独立性.
- 准确性与官方答案相比进行了测量,并验证了答案的一致性.
- 绩效与医学专家和平均MIR候选人的共识进行了比较.
主要成果:
- GPT-4o获得了89.8%的准确性 (90%的验证),OpenAI o1获得了92.6% (93.2%的验证).
- 无论是LLM和医疗专家都显著超过了平均MIR候选人的表现 (56.6%).
- 随着问题难度的增加,LLM准确性下降,对于临床病例和积极问题略高.
结论:
- 在MIR 2024检查中,GPT-4o和OpenAI o1表现出卓越和一致的准确性.
- 士学位为医学教育和准备执照考试提供了有前途的机会.
- 未来的研究应该调查影响LLM准确性的因素,并评估新兴的人工智能模型.
关键词:
在 GPT-4o 中.在MIR 2024的考试中.医生内部居民.开放AI o1 o1 的时间.准确度 准确度 准确度 准确度人工智能的人工智能是人工智能.大型语言模型.医学教育 医学教育医疗检查 医学检查更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.0K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
