作为一个董事会认证的外科医生GPT-4:一个试点研究
Joshua A Roshal1,2, Caitlin Silvestri3, Tejas Sathe3
1University of Texas Medical Branch, 301 University Blvd, Galveston, TX 77551 USA.
Medical science educator
|July 8, 2025
概括
像GPT-4这样的大型语言模型对外科教育有希望,在多项选择测试中表现出色,但在复杂的口头板场景中扎. 临床决策应用需要进一步开发.
科学领域:
- 医疗教育中的人工智能
- 手术培训技术手术培训技术
- 大型语言模型 (LLM)
背景情况:
- 大型语言模型 (LLM) 显示了彻底改变外科教育的潜力.
- 对LLM准确性和可靠性的怀疑阻碍了在医学培训中采用.
- 已知GPT-4在多项选择题上的表现,但其在口头检查中的临床判断不太清楚.
研究的目的:
- 通过模拟书面和口头的董事会式考试来评估GPT-4的整体外科知识.
- 确定在外科教育和实践的LLMs中需要改进的领域.
- 评估GPT-4在模拟高风险临床决策场景中的可靠性.
主要方法:
- GPT-4回答了250个多选题 (MCQ) 来自外科住院教育委员会 (SCORE) 问题库.
- 根据可信任的专业活动 (EPA) 主题列表,GPT-4导航了4个口头板场景.
- 答案的准确性被两个前面面试官独立评估.
主要成果:
- 在MCQ中,GPT-4的准确率达到78.8%,表明通过美国外科医学会合格考试 (ABS QE) 的概率为92%.
- 在75%的口头董事会场景中,GPT-4在4个案例中3个案例中出现了关键失败.
- 关键的失败点包括错误的干预时间和不适当的手术建议.
结论:
- GPT-4的高MCQ性能与之前的研究结果一致,但它在生成精确的长形式内容方面存在局限性.
- 对于复杂的临床决策,LLM性能需要显著改进.
- 未来的研究应该专注于专门的数据集和先进的强化学习,以提高在外科背景下LLM的能力.


