评估骨科GPT的有效性:与医学学生和一般LLM对骨科检查问题的比较研究
Philippe Fabian Pohlmann1, Maximilian Glienke2, Richard Sandkamp2
1Department of Urology, Medical Center-University of Freiburg, Faculty of Medicine, University of Freiburg, 79106 Freiburg, Germany.
Bioengineering (Basel, Switzerland)
|December 30, 2025
概括
特定领域的Ortho GPT在骨科考试中表现优于一般的大型语言模型 (LLM),证明了对医学教育的卓越准确性和相关性. 这种专门的人工智能显示出与课程一致的支持的希望.
科学领域:
- 医疗教育中的人工智能
- 医疗保健的自然语言处理.
- 域特定的大型语言模型
背景情况:
- 一般用途的大型语言模型 (LLM) 可能缺乏专门医疗教育所需的准确性和上下文相关性.
- 特定领域的LLM,如Ortho GPT,在特定医学领域的事实准确性和相关性方面提供了潜在的优势.
- 与一般模型和人类专家相比,评估专门的LLM的表现对于理解其教育实用性至关重要.
研究的目的:
- 与领先的一般大语言模型 (LLM) 和高级医学学生对比,评估Ortho GPT的性能.
- 评估验证的骨科检查问题LLM答案的准确性和上下文相关性.
- 确定特定领域的LLM对于支持骨科医学教育的实用性.
主要方法:
- 六个大型语言模型 (LLM),包括Ortho GPT 4o和各种一般模型,在多选项骨科考试问题上进行了测试.
- 模型在标准化零射击条件下使用来自医学学生最后一年考试的德语问题进行评估.
- 绩效指标包括准确率,麦克纳马的测试显著差异,贾卡德相似性,和学生难度评级的相关性.
主要成果:
- 在所有测试的LLM中,Ortho GPT表现出最高的准确性,明显超过了几种通用模型.
- 在统计学上,Ortho GPT的表现与ChatGPT 4o相美,这是评估中最强的一般模型.
- 没有LLM成绩与学生感知的项目难度相关,表明独立的问题解决方法.
结论:
- 与一般的LLM相比,Ortho GPT在骨科检查中表现出更高的准确性和上下文相关性,这归因于其专业培训.
- 特定领域的LLM可以与骨科等专业领域的顶级普通LLM的表现相匹配或超过.
- 专业的LLM对于在医学教育中提供可靠,与课程一致的支持至关重要.


