人工智能与医疗医学:评估ChatGPT-4的外科决策准确性
Deanna L Palenzuela1, John T Mullen1, Roy Phitayakorn2
1Massachusetts General Hospital, Boston, MA.
Surgery
|May 20, 2024
概括
与初级住院医生相比,ChatGPT-4表现出优越的外科决策能力,并与高级住院医生和护理人员相匹配. 这表明大型语言模型可以成为外科培训的有价值的教育工具.
科学领域:
- 人工智能在医学中的应用
- 手术教育技术 技术手术教育
背景情况:
- 像ChatGPT-4这样的大型语言模型 (LLM) 显示了提高医学教育的前景.
- 在外科培训中应用LLM,特别是决策,需要严格的评估.
研究的目的:
- 评估ChatGPT-4的外科决策与一般外科住院医生和主持外科医生的准确性.
- 为了比较不同水平的外科专业知识的LLM的表现.
主要方法:
- 基于真实患者数据开发了五种临床情景.
- 聊天GPT-4和人类参与者 (初级居民,高级居民,护理人员) 响应了决策提示.
- 通过使用标准化标题来评分答案,并对结果进行统计分析.
主要成果:
- 聊天GPT-4的平均得分为79.2%,明显超过了初级居民 (66.8%).
- 聊天GPT-4的表现与老年居民 (76.0%) 和护理人员 (77.6%) 的表现相当.
- 与初级医师相比,LLM在识别正确的手术和推术后修复方面表现出色.
结论:
- 在模拟的患者场景中,ChatGPT-4在初级外科住院医生方面表现优越,在高级住院医生和护理人员方面表现相当.
- LLM具有作为补充教育资源来发展外科决策技能的潜力,特别是对于初级学员来说.


