大型语言模型作为临床决策支持工具在重症儿童的初始管理:一个试点评估
Osnat Tausky1, Eytan Kaplan2,3, Gili Kadmon2,3
1Department of Pediatrics B, Schneider Children's Medical Center of Israel, Petach Tikva, Israel.
European journal of pediatrics
|November 14, 2025
概括
大型语言模型在儿科重症监护诊断和分类方面表现有前途. 然而,由于潜在的危害和遗漏,需要对治疗建议保持谨慎.
科学领域:
- 人工智能在医学中的应用
- 儿科重症监护 儿科重症监护
- 临床决策支持系统 临床决策支持系统
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 正被评估为临床决策支持工具.
- 目前对LLM诊断潜力的研究主要针对成年人群,实际患者病例的儿科数据有限.
- 在儿科急性护理环境中,LLM的可靠性在很大程度上仍未得到检查.
研究的目的:
- 评估ChatGPT-4.0在重症儿童早期治疗中的表现.
- 评估ChatGPT-4.0的诊断和治疗建议与儿童重症监护室 (PICU) 设置中的实际临床护理.
- 识别针对儿科患者的LLM生成的临床计划中的潜在安全问题和遗漏.
主要方法:
- 对20名进入第三级PICU的重症儿童进行了回顾性分析.
- 聊天GPT-4.0在四个关键时间点被提示:ED到达,ED转移,PICU入院,并在PICU停留24小时.
- 对诊断和治疗计划,差异诊断和分拣决策的LLM输出与实际临床护理进行了比较,并评估了准确性,安全性和遗漏.
主要成果:
- 聊天GPT-4.0在诊断建议 (94%在ED,98%在PICU) 和准确的分组决策方面表现出很高的适当性.
- 与诊断建议相比,治疗建议的适当性较低 (82%),潜在有害建议的发生率较高 (ED的7%,PICU的10%).
- 在PICU中,严重缺失的治疗建议 (每病例0.95) 比诊断缺失 (每病例0.15) 更频繁.
结论:
- 在儿科重症监护中,ChatGPT-4.0表现出强大的诊断和分类能力.
- 治疗建议需要高度谨慎,因为准确性较低,潜在的危害和遗漏.
- 在儿童急性护理中广泛采用LLM之前,需要进一步的研究和验证,特别是在治疗计划方面.
更多相关视频
07:31Implementation of a Real-Time Psychosis Risk Detection and Alerting System Based on Electronic Health Records using CogStack
Published on: May 15, 2020
7.5K
08:58Development of a Neonatal Piglet Acute Lung Injury Model Recreating the Early Environment of Preterm Infant Lungs
Published on: October 31, 2025
522
