外科医生与聊天GPT:评估和反性能基于真实的外科手术场景
Cristián Jarry Trujillo1, Javier Vela Ulloa1, Gabriel Escalona Vivas1
1Experimental Surgery and Simulation Center, Department of Digestive Surgery, Pontificia Universidad Católica de Chile, Santiago, Chile.
Journal of surgical education
|May 15, 2024
概括
在外科教育场景中,ChatGPT向经验丰富的外科医生展示了可比的错误检测和反质量. 这种人工智能工具显示出提高外科手术技能和培训效率的巨大潜力.
科学领域:
- 医学教育 医学教育
- 在外科手术中使用人工智能
- 外科手术技能的评估.
背景情况:
- 人工智能 (AI) 越来越多地被用于医学和外科教育.
- 像ChatGPT这样的大型语言模型 (LLM) 提供了提供反以提高外科手术技能的潜力.
- 这项研究评估了ChatGPT在提供外科手术情景反方面的有效性.
研究的目的:
- 评估ChatGPT对手术场景提供建设性反的能力.
- 将ChatGPT的反质量和实用性与经验丰富的外科医生进行比较.
- 确定人工智能工具在外科手术技能发展中的潜力.
主要方法:
- 手术场景被转换成中立文字叙述.
- 聊天GPT 4.0和三个外科医生评估这些文本,识别错误并提供反.
- 外科住院医生,教育专家 (EE) 和临床专家 (CE) 评估了反的实用性和质量.
主要成果:
- 在96.43%的住院评估中,ChatGPT的反被认为是有用的,与外科医生B和C相当.
- 聊天GPT和外科医生在反质量 (FQ) 上获得了相似的分数.
- 根据EE,ChatGPT获得的FQ得分高于外科医生A和B的FQ得分,并且与CE的外科医生A和C的得分相似.
结论:
- 聊天GPT有效地识别了手术场景中的错误,其检测率与经验丰富的外科医生相似.
- 人工智能产生的反对于改善外科手术技能是有价值的,其表现与人类教练相提并论.
- 居民,EE和CE经常认为ChatGPT的反是人为的,这表明它的自然主义质量.


