使用大型语言模型来检测医院获得的疾病:关于肺栓塞的经验研究
Cheligeer Cheligeer1,2, Danielle A Southern1, Jun Yan3
1Centre for Health Informatics, Cumming School of Medicine, University of Calgary, Calgary T2N 4N1, Canada.
概括
大型语言模型 (LLM) 在电子病历 (EMR) 中显示出高灵敏度和特异性来检测肺栓塞不良事件 (PEAE). 虽然对查有效,但它们的低正预测值需要进一步审查图表以确定诊断.
科学领域:
- 医疗保健中的人工智能
- 临床信息学 临床信息学
- 医学自然语言处理 医学自然语言处理
背景情况:
- 在电子医疗记录 (EMR) 中检测不良事件是具有挑战性的,因为发病率低,数据变化和复杂性.
- 作为不良事件的肺栓塞 (PEAE) 特别难以用当前的方法识别.
研究的目的:
- 开发和评估基于大型语言模型 (LLM) 的框架,用于从非结构化的EMR叙事数据中检测PEAE.
- 评估开源LLM在识别PEAE方面的表现及其对人口层面监测的有用性.
主要方法:
- 对来自三级医院的10,066名成年患者 (2017-2022) 的病历审查进行了.
- 开发了一个LLM框架,包括证据提取 (关键字和语义过),排放信息提取和PEAE检测模块.
- 使用标准性能指标评估了四个开源的LLM (Llama3,Mistral-7B,Gemma,Phi-3).
主要成果:
- 所有LLM都表现出高灵敏度 (87.5-100%) 和特异性 (94.9-98.9%).
- 杰玛获得了最高的F1得分 (28.11%),包括基于关键字的检索和解禁摘要.
- 基于关键字的过显著减少了数据处理负载,LLM与年度PEAE趋势有很强的相关性 (r=0.92-0.99).
结论:
- LLM可以有效地从高灵敏度和特异性的EMR中检测到PEAE,作为有价值的选工具.
- 由于LLM的阳性预测值很低,因此需要继续审查图表以确定PEAE诊断.
- 未来的研究应该专注于改善上下文理解和医学术语解释,以提高准确性.


