在韩国医学执照考试中对大型语言模型的绩效评估:为期三年的比较分析
Hyun Jin Kim1,2, Kiwook Jung3,4, Sunghwan Shin5
1Department of Laboratory Medicine, Chungnam National University School of Medicine, Daejeon, Korea.
Scientific reports
|October 15, 2025
概括
大型语言模型 (LLM) 在韩国医学执照考试中表现强,GPT-4o获得了最高的准确性. 这些人工智能工具为医学教育和评估提供了潜力,尽管基于图像的问题存在挑战.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 自然语言处理自然语言处理.
背景情况:
- 在非英语医学执照考试中评估大型语言模型 (LLM) 是至关重要的,但未被充分探索.
- 现有的研究往往忽视了LLMs在基于文本和图像的医学问题上的表现.
研究的目的:
- 评估韩国医学执照考试 (KMLE) 的三个领先的LLM (GPT-4o,Claude 3.5 Sonnet,Gemini 1.5 Pro) 的表现和可靠性.
- 分析不同问题格式 (仅以文本形式,以图像形式) 和医学专业的LLM绩效.
- 在高风险的医学评估背景下,评估LLM绩效的可复制性和模型间协议.
主要方法:
- 从2022-2024年利用了942个KMLE问题,涵盖了各种医学专业.
- 进行重复测试以评估可重复性和对对比,以获得模型间的协议.
- 分析了准确性,不同类型问题的表现差异,以及学科特定的优缺点.
主要成果:
- GPT-4o显示了最高的准确性 (83.2%),其次是克劳德3.5索内特 (79.5%) 和双子1.5Pro (76.6%).
- 法律法学士在内科,儿科和精神病学方面表现最好,在医学法领域的准确性较低.
- 可复制性很好 (97.7%-99.9%),GPT-4o和Claude 3.5 Sonnet.之间有很强的一致性.
结论:
- 在非英语环境中,LLM也表现出有能力的医学知识评估能力.
- 在基于图像的处理问题和高度专业化的医疗领域仍然存在挑战.
- 研究结果表明,LLM可以为未来的医学教育和评估工具提供信息,等待现实世界的验证.
相关概念视频
Improving Translational Accuracy
3.5K
3.5K
Improving Translational Accuracy
14.1K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.1K

