大型语言模型在医疗执照考试中的表现:系统审查和元分析
Haniyeh Nouri1, Abdollah Mahdavi2, Ali Abedi3
1Student Research Committee, School of Medicine, Ardabil University of Medical Sciences, Ardabil, Iran.
Journal of educational evaluation for health professions
|November 17, 2025
概括
大型语言模型 (LLM) 在医疗执照考试中表现有前途,GPT-4达到81%的准确性. 虽然LLMs是有用的教育工具,但由于潜在的错误,LLMs应该补充,而不是取代传统的学习.
科学领域:
- 医疗教育 技术 技术 医学教育
- 医疗保健中的人工智能
- 人工智能模型的性能评估
背景情况:
- 大型语言模型 (LLM) 在医学教育中的整合正在迅速发展.
- 在高风险的医学检查中评估LLM的有效性对于了解其潜力和局限性至关重要.
研究的目的:
- 系统地评估和比较各种LLM在回答医疗执照考试问题的表现.
- 根据语言,问题格式和模型类型进行子组分析,以提供LLM能力的全面概述.
主要方法:
- 一个系统的审查和元分析,遵循PRISMA指南.
- 在MEDLINE,Scopus和Web of Science中搜索了评估医学执照考试LLM准确性的研究.
- 使用随机效应模型与子组分析和出版偏差评估的聚合准确性.
主要成果:
- 包括最初2,404项研究中的36项研究,报告总LLM准确率为72%.
- 在GPT-4中,准确度最高 (81%),其次是Bing (79%),Claude (74%),Gemini/Bard (70%),以及GPT-3.5 (60%).
- 在不同语言之间没有观察到统计学上显著的绩效差异.
结论:
- 在执照考试中,LLM,特别是GPT-4,可以在医学学生的水平或以上的水平上表现.
- 虽然LLM显示出作为辅助教育工具的潜力,但由于变化和错误风险,LLM需要谨慎使用,作为传统学习方法的补充.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1000
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
