医学教育中临床场景生成的大型语言模型的比较:一种混合方法研究
1Department of Medical Education, Faculty of Medicine, Aydın Adnan Menderes University, Aydın, Turkey. selcenoncu@gmail.com.
BMC medical education
|February 24, 2026
概括
克劳德人工智能在为土耳其医学学生生成现实和教学上健全的临床案例场景方面表现出卓越的表现. 这种人工智能工具为传统的医学教育方法提供了有希望的补充.
科学领域:
- 医学教育 医学教育
- 医疗保健中的人工智能
- 临床模拟 临床模拟
背景情况:
- 传统的临床病例管理培训面临挑战,原因是患者安全,机会有限,教师工作量.
- 人工智能 (AI),特别是大型语言模型 (LLM),为补充临床培训提供了创新的解决方案.
- 法律学士可以为基于能力的医学教育产生多样化,互动性和特定的临床场景.
研究的目的:
- 评估和比较四种LLM (ChatGPT-4o,Claude 3.7 Sonnet,Gemini 1.5,DeepSeek) 在生成临床场景中的有效性.
- 评估LLM为土耳其本科医学教育生成的场景的教育实用性.
- 确定生产最准确,可理解和与国家标准一致的教学上适当内容的LLM.
主要方法:
- 融合平行混合方法设计,使用基于国家医学教育指南的标准化提示.
- 每个LLM都为三个常见的传染病生成了土耳其语的临床场景.
- 25名高级医学学生和5名专家临床医生使用结构化评级表格和定性反对场景的评估.
主要成果:
- 克劳德3.7小说在清晰度,现实主义和临床推理支持方面获得了最高评分.
- 从统计学上显著的差异有利于克劳德超过双子座和DeepSeek (p <0.05).
- 质量反强调了Claude的教育价值和语言精确性;ChatGPT的表现适度,而双子座和DeepSeek在现实主义和连贯性方面存在问题.
结论:
- 克劳德获得了最高的评分,因为它为本科医学教育提供了临床上适当和教学上有用的土耳其语场景.
- 结果提供了关于LLM产生的场景质量的初步证据,支持进一步的多中心和以结果为中心的研究.
- 未来的研究应该探索LLM场景作为基于模拟的学习中的补充材料.


