在紧急塑性手术决策中对大型语言模型的比较分析:体检数据的作用
Sahar Borna1, Cesar A Gomez-Cabello1, Sophia M Pressman1
1Division of Plastic Surgery, Mayo Clinic, Jacksonville, FL 32224, USA.
Journal of personalized medicine
|June 27, 2024
概括
大型语言模型 (LLM) 在紧急整形手术决策方面表现有前途. 与谷歌双子相比,ChatGPT-4显示出更高的诊断和管理准确性,支持临床专业知识.
科学领域:
- 医疗人工智能 医疗人工智能
- 临床决策支持系统 临床决策支持系统
- 整形和重建手术 整形和重建手术
背景情况:
- 诊断错误是美国医疗保健的一个重大问题,源于复杂的病例和分散的护理.
- 不充分的初始患者评估经常导致诊断不准确.
- 塑性和重建性外科手术中的紧急决策提出了独特的挑战.
研究的目的:
- 评估大型语言模型 (LLM) 在紧急整形手术场景中的诊断和管理能力.
- 为了比较OpenAI的ChatGPT-4和Google Gemini在协助临床决策方面的表现.
- 评估体检数据对这些紧急环境中的LLM绩效的影响.
主要方法:
- 使用了30张详细介绍紧急情况 (如骨折,神经损伤) 的医学图片.
- 来自ChatGPT-4和Google Gemini的回复被分析,包括和没有体检数据.
- 医疗专业人员根据临床指南评估了LLM输出,使用统计分析 (Wilcoxon排行和值测试).
主要成果:
- 在诊断准确性和管理建议方面,ChatGPT-4的表现始终优于Google Gemini.
- 包括体检数据并没有导致每个模型的性能在统计学上显著改善.
- 虽然LLM的答案详细地提供了物理数据,但在整体有效性方面并没有明显超过传统医疗资源.
结论:
- 与谷歌双子相比,ChatGPT-4在紧急整形手术决策支持方面表现出更高的准确性和有效性.
- 在临床决策中,LLM可以作为有价值的辅助工具,尤其是在数据有限的情况下.
- 人工智能工具应该补充,而不是取代全面的临床评估和专家医疗判断.


