在临床实践中评估大型语言模型的局限性 临床实践指导方针-一致的治疗决策 基于现实世界的数据:回顾性研究
Tobias Roeschl1,2,3,4,5, Marie Hoffmann2,4,5, Djawid Hashemi1,2,3,4
1Department of Cardiology, Angiology and Intensive Care Medicine, Deutsches Herzzentrum der Charité, Berlin, Germany.
大型语言模型 (LLM) 在治疗决策中与现实世界的临床数据作斗争. 精心策划的输入对于医疗保健中准确,公正的LLM绩效至关重要.
科学领域:
- 人工智能在医学中的应用
- 临床决策支持系统 临床决策支持系统
背景情况:
- 大型语言模型 (LLM) 在治疗决策方面表现有前途,但之前的研究使用了高度精选的患者数据.
- 在使用非结构化数据的真实临床场景中,LLM的有效性在很大程度上仍未得到研究.
研究的目的:
- 利用典型的临床数据,评估各种大型语言模型 (LLM) 对于严重的大动脉狭窄的指导方针一致的治疗决策的能力.
- 根据输入数据格式 (非结构化医疗报告与病例摘要) 和快速增强来评估LLM绩效.
主要方法:
- 这是一项对80名在2022年接受治疗的重症大动脉狭窄患者的回顾性研究.
- 使用匿名原始医疗报告和手动生成的病例摘要,对多名LLM进行了查询.
- 通过与机构核心团队决策 (科恩 κ),可靠性 (ICC) 和公平性 (FBI) 的协议来衡量绩效.
主要成果:
- 在原始的,非结构化的医疗报告中,LLM表现不佳 (科恩 κ: -0.47到0.22).
- 通过案例摘要和添加指南知识 (科恩 κ: -0.02至0.63) 显著提高了业绩.
- 所有测试的LLM都表现出幻觉,并观察到对TAVR的偏见 (FBI:0.46-1.51).
结论:
- 先进的LLM需要精心策划的输入,以便可靠的临床决策.
- 幻觉和偏见的存在需要在现实世界医疗保健环境中实施LLMs时谨慎行事.
- 需要进一步的研究来提高临床应用的LLM准确性和安全性.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
07:31Implementation of a Real-Time Psychosis Risk Detection and Alerting System Based on Electronic Health Records using CogStack
Published on: May 15, 2020
相关概念视频
Methods of Documentation VI: Case Management Model
For example, a patient with a chronic...
Types of Biopharmaceutical Studies: Controlled and Non-Controlled Approaches
Non-controlled studies, commonly employed for initial exploration, lack a control group, rendering them susceptible to biases and external influences. In contrast,...
Language and Cognition
Analysis of Population Pharmacokinetic Data
Therapeutic Drug Monitoring: Affecting Factors
