大型语言模型在经手术风险预测和预后方面的能力
Philip Chung1, Christine T Fong2, Andrew M Walters2
1Department of Anesthesiology, Perioperative & Pain Medicine, Stanford University, Stanford, California.
JAMA surgery
|June 5, 2024
概括
大型语言模型在预测外科手术结果 (如死亡率和入院率) 中表现有希望,但在预测持续时间方面存在困难. 它们的解释能力可以增强临床工作流程.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 预测外科手术风险预测
背景情况:
- 一般领域的大型语言模型 (LLM) 提供了分析电子健康记录 (EHR) 以支持临床决策的潜力.
- 准确的手术前风险分层对于优化患者护理和资源配置至关重要.
研究的目的:
- 评估GPT-4 Turbo LLM在八个不同的外科手术期结果测量项上的预测性表现.
- 评估LLM使用患者电子病历数据预测分类和数值结果的能力.
主要方法:
- 一项使用四级护理中心追溯EHR数据的预后研究.
- GPT-4 Turbo被提示使用患者病例和注释数据来预测结果,包括美国麻醉学会身体状况 (ASA-PS),入院,死亡率和停留时间.
- 提示策略包括原始笔记,摘要,少数镜头和思维链进行了比较.
主要成果:
- 该LLM取得了强大的预测性表现对分类结果,F1得分从0.50 (ASA-PS) 到0.86 (医院死亡率).
- 对于数值持续时间结果 (PACU,医院和ICU停留时间) 的预测准确性在所有提示策略中都很差.
- 该模型展示了基于提示技术的不同性能,特定策略在某些任务中产生更好的结果.
结论:
- 一般领域的LLM可以帮助分类任务的外科手术期风险分层,但目前还不足以预测数值持续时间的结果.
- 该法学士的产生自然语言解释的能力提高了其在临床工作流程中的潜在实用性.
- 临床医学模型可以作为现有风险预测模型的补充工具,改善临床决策.


