在手术自我评估考试上ChatGPT的表现:一个批判性分析
Yuri Han1, Hassaam S Choudhry2, Michael E Simon1
1Rutgers Robert Wood Johnson Medical School, New Brunswick, NJ.
Journal of hand surgery global online
|June 21, 2024
概括
聊天生成预训练变压器 (ChatGPT) 在手术自我评估考试中表现不佳,即使在仅为文本的问题上,得分也低于通过门. 需要进一步发展专业医疗知识的熟练程度.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 手术知识评估评估手术知识评估
背景情况:
- 人工智能 (AI) 在医学教育和评估中的整合正在迅速发展.
- 在专业医疗领域评估像ChatGPT这样的大型语言模型的能力对于了解其潜力和局限性至关重要.
- 手术自我评估考试为专业医疗知识提供了严格的测试.
研究的目的:
- 评估ChatGPT在回答手术自我评估问题的准确性.
- 为了比较ChatGPT在纯文本和基于图像的问题上的表现.
- 确定AI可能需要进一步开发用于医疗应用的领域.
主要方法:
- 利用了美国手术学会 (ASSH) 10年 (2004-2013) 的自我评估考试.
- 评估了ChatGPT在1583个问题上的表现,区分了纯文本和基于图像的格式.
- 分析得分,提供解释,阐述长度和答案确定性.
主要成果:
- 总体而言,ChatGPT仅正确回答了36.2%的问题.
- 与基于图像的问题 (28.7%的正确性) 相比,仅基于文本的问题 (39.2%的正确性) 的表现明显更好.
- 自信的答案比不自信的答案 (17.6%) 更经常 (38.0%) 正确,但整体准确性仍然很低.
结论:
- 在ASSH自我评估考试中,ChatGPT表现不佳,这表明他们缺乏手术知识.
- 即使是纯文本问题,得分也低于医疗认证的合格要求.
- 当前的人工智能模型在专业医学知识评估和继续教育中使用时需要谨慎使用.


