医学教育中的大型语言模型:在回答组织学问题时进行比较的跨平台评估
Volodymyr Mavrych1, Einas M Yousef1, Ahmed Yaqinuddin1
1College of Medicine, Alfaisal University, Riyadh, Kingdom of Saudi Arabia.
Medical education online
|July 12, 2025
概括
大型语言模型 (LLM) 在医学组织学问题中表现出高精度,显示出AI.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 历史学 历史学 历史学
背景情况:
- 大型语言模型 (LLM) 在医学中显示出潜力,但需要在基础科学中进行评估.
- 医学组织学,其事实和解释要求,是评估AI在教育中的一个关键领域.
研究的目的:
- 为了比较五个领先的LLM在医学组织学多选题 (MCQs) 的表现.
- 评估这些AI模型的准确性,测试-重新测试可靠性和专题特定性能.
主要方法:
- 一项横截面比较研究使用了200个USMLE风格的组织学MCQ,涉及20个主题.
- 五位LLM (GPT-4.1,克劳德3.7索内特,双子座2.0闪光,副驾驶员,深度搜索R1) 在三次尝试中回答了问题.
- 通过准确率和可靠性的类内相关系数 (ICC) 来衡量性能.
主要成果:
- 所有的LLM都实现了高平均准确率 (91.1%).
- 双子座 (92.0%) 和克劳德 (91.5%) 的准确性略高,模型之间没有统计学上显著的差异.
- 克劳德 (ICC=0.931) 和GPT-4 (ICC=0.882) 的可靠性最高. 肌肉组织和淋巴系统的主题是最具挑战性的.
结论:
- 在组织学MCQ中,LLM表现出异常的准确性和可靠性,超过了其他医学领域的表现.
- 虽然人工智能显示出技术成熟度,但特定主题和可靠性的挑战强调了对人类监督的需求.
- 组织学非常适合人工智能辅助的医学教育,反映了人工智能能力的快速进步.


