评估大型语言模型在ASPS现役考试中的表现:与居民规范进行比较分析
Ramin Shekouhi1, Mary M Holohan1, Oygul Mirzalieva2
1Division of Plastic and Reconstructive Surgery, Department of Surgery, Louisiana State University Health Sciences Center, New Orleans, LA, USA.
Journal of plastic, reconstructive & aesthetic surgery : JPRAS
|November 27, 2025
概括
领先的大型语言模型 (LLM) 在整形外科实习培训考试 (PSITE) 中显示出高准确度,经常超过住院医生和从业人员的表现. 这表明他们在外科教育中的潜力.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 整形外科 整形外科 整形外科
背景情况:
- 大型语言模型 (LLM) 正在成为医学教育中的潜在工具.
- 他们的表现在专业领域,如整形外科手术需要彻底评估.
研究的目的:
- 评估三个主要的LLM的准确性和比较性能:ChatGPT 4.0,DeepSeek V3和Gemini 2.5.5.
- 在20年的时间内,对这些LLM在美国塑料手术委员会塑料手术现役培训考试 (PSITE) 中进行评估.
主要方法:
- 在两十年的时间里,LLM在PSITE问题上进行了测试.
- 绩效通过整体准确度和百分位与居民和从业者的规范性数据进行测量.
主要成果:
- 聊天GPT,DeepSeek和Gemini的总体准确度高且可比较 (分别为75.0%,74.8%,74.5%),没有统计学上显著的差异.
- 深度搜索获得了最高百分位 (第81位居民,第89位从业者),紧随其后的是ChatGPT和Gemini,在LLMs之间没有显著差异.
结论:
- 现代的LLM在PSITE上表现出一致的,高水平的性能.
- 这些先进的AI模型经常超过整形外科住院医生和从业人员的中位数表现,这表明外科培训和教育的巨大潜力.


