相关实验视频
Updated: May 6, 2026

07:30
Learning Modern Laryngeal Surgery in a Dissection Laboratory
Published on: March 18, 2020
8.2K
大型语言模型在欧洲一般外科委员会考试中表现不佳:与专家和外科实习生进行的比较研究
1Department of Gastrointestinal Surgery, Afyonkarahisar State Hospital, Afyonkarahisar, Türkiye. opdrmelihcangul@gmail.com.
BMC medical education
|August 24, 2025
概括
人工智能 (AI) 模型在考试问题上的准确性低于人类外科医生. 人工智能工具最好用于补充,而不是取代外科教育中的专家临床判断.
科学领域:
- 医疗教育
- 人工智能
- 手术评估
背景情况:
- 人工智能 (AI) 越来越多地被用于医学教育和评估.
- 像GPT-4o这样的AI模型在高风险的医疗检查中显示出可变的性能.
- 这项研究评估了人工智能在手术板测试中对人类专家的表现.
研究的目的:
- 将四个人工智能模型 (Llama-3,Gemini,GPT-4o,Copilot) 的准确性与专家和住院医生对欧洲整体外科委员会的问题进行比较.
- 根据问题格式,长度和难度分析人工智能性能.
- 确定人工智能在外科教育和评估中的当前作用.
主要方法:
- 使用了一般外科检查中的120个多选题.
- 四个人工智能模型和30名外科医生 (专家和住院医生) 在定时条件下回答问题.
- 问题根据长度和难度进行分类,并使用ANOVA进行准确比较.
主要成果:
- 经过认证的外科医生达到81.6%的准确率,
- 在AI模型中,Llama-3的表现最好,为65.8%,Copilot的表现最低,为51.7%.
- 人工智能性能与人类性能不同,随着问题的长度和难度而下降.
结论:
- 目前的大型语言模型 (LLM) 在高层医学知识评估中表现不佳.
- 在外科教育中,LLM是有价值的补充工具.
- 在外科实践中,人工智能不应取代专家的临床判断.

