评估ChatGPT在临床多学科治疗中的性能:一项回顾性研究
Xueqi Wang1, Jianhua Guo1, Tao Zhang1
1Department of Critical Care Medicine, Shanghai East Hospital, Tongji University School of Medicine, No.150, Jimo Road, Pudong New Area, Shanghai, 200120, China.
BMC medical informatics and decision making
|September 27, 2025
概括
像ChatGPT这样的大型语言模型 (LLM) 在多学科治疗 (MDT) 咨询中表现有希望,提供全面的见解. 然而,目前的LLM需要进一步发展,以确保临床决策的准确性和安全性.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
- 在医疗保健中的自然语言处理.
背景情况:
- 多学科治疗 (MDT) 咨询对于复杂的患者管理至关重要,但面临着资源和时间的限制.
- 大型语言模型 (LLM) 在临床决策中表现出潜力,但它们在复杂的MDT场景中的有效性尚未得到充分证实.
- 这项研究评估了ChatGPT在产生MDT建议方面的表现,与医生生成的建议相比.
研究的目的:
- 评估ChatGPT产生的MDT建议的质量.
- 将ChatGPT的建议与经验丰富的医生的建议进行比较.
- 确定LLM辅助临床决策支持的优势和弱点.
主要方法:
- 64例患者病例的回顾性分析.
- 聊天GPT为每个案例生成了具体的MDT建议.
- 两名医生对源头失明,对综合性,准确性,可行性,安全性和效率进行了评分.
主要成果:
- 聊天GPT的整体中位数得分 (41.0/50.0) 低于医生 (43.5/50.0) (p=0.001).
- 聊天GPT在全面性 (p<0.001) 方面表现优于医生,但在准确性 (p<0.001),可行性 (p<0.001) 和效率 (p=0.003) 方面表现差.
- 聊天GPT通过复杂的病例病因学进行推理.
结论:
- 聊天GPT显示了全面的MDT建议的潜力,但存在显著的准确性缺陷.
- 目前的LLM需要进一步开发和临床验证才能在医疗保健中得到广泛采用.
- 由于确定的局限性,在临床实践中谨慎使用LLM至关重要.


