多种大型语言模型在中国医学执照考试中的表现:量化比较研究.
Yanyu Diao1, Mengyuan Wu1, Jingwen Xu1
1The School of Big Data and Artificial Intelligence, Anhui Xinhua University, 555 Wangjiang West Road, Hefei, 230088, China, 86 15905667742.
JMIR human factors
|December 16, 2025
概括
像DeepSeek这样的GPT-4和中国LLM对医学教育有前景,在中国国家医学执照考试 (NMLE) 上表现良好. 复杂的任务需要进一步开发,但这些人工智能工具可以补充医疗培训.
科学领域:
- 医疗教育中的人工智能
- 医疗保健中的自然语言处理 (NLP)
- 大型语言模型 (LLM) 绩效评估
背景情况:
- 聊天GPT的功能是众所周知的,但其在中国国家医疗执照考试 (NMLE) 和中国医学教育中的表现在很大程度上未经检查.
- 新兴的基于中国语料库的大型语言模型 (LLM),包括ERNIE Bot,Tongyi Qianwen,Doubao和DeepSeek,需要对其在NMLE环境中的有效性进行系统评估.
研究的目的:
- 从数量上比较六个领先的LLM (GPT-3.5,GPT-4,ERNIE Bot,Tongyi Qianwen,Doubao和DeepSeek) 在NMLE问题上的表现,从2018年到2024年.
- 评估这些LLM作为中国医学教育中的补充教育工具的可行性.
主要方法:
- 在四个内容单元中,从2018-2024年开始选择NMLE通用书面测试问题.
- 基于图像和表格的内容预处理为标准化的文本格式,用于LLM输入.
- 基于准确性,全面性和逻辑连贯性的LLM答案的评估,与官方答案密钥进行基准对比,通过分数为360/600.
主要成果:
- 在所有测试单位中,GPT-4的性能始终超过了GPT-3.5,实现了高准确率.
- 在中国的LLM中,DeepSeek的整体表现最高,平均准确度明显超过其他国内模型,接近GPT-4的水平.
- GPT-4 (77.0%准确率) 和DeepSeek (75.8%准确率) 均显著超过了GPT-3.5 (68.5%准确率),并超过了NMLE通过值,表明它们的潜在实用性.
结论:
- 像DeepSeek这样的GPT-4和高级中国LLM显示出作为中国医学教育的补充工具的巨大潜力,其在NMLE上的强表现证明了这一点.
- 对于这些人工智能模型,在复杂推理,多式联络处理和动态知识更新等领域需要进一步的进步.
- 人类医学专业知识仍然是临床实践和教育不可或缺的,人工智能工具作为支持资源而不是替代品.


