从心房患者的非结构化临床笔记中提取CHA2DS2-VASc风险因子的检索增强生成
Philip Adejumo1, Phyllis Thangaraj1, Sumukh Vasisht Shankar1
1Section of Cardiovascular Medicine, Department of Internal Medicine, Yale School of Medicine, New Haven, CT.
medRxiv : the preprint server for health sciences
|October 7, 2024
概括
一种新的回收增强生成 (RAG) 模型准确地从心房患者的临床笔记中提取中风风险因素. 这增强了风险评估,并指导了抗凝治疗决策.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持 临床决策支持
背景情况:
- 精确的中风风险评估心房动 (AF) 对于有效的抗凝治疗至关重要.
- 目前的方法依赖于手动CHA2DS2-VASc得分计算或有限的结构化电子健康记录 (EHR) 数据.
- 非结构化的临床注释提供了丰富的,未充分利用的数据,以改善风险分层.
研究的目的:
- 开发和验证一种检索增强生成 (RAG) 方法,用于从非结构化的AF患者临床笔记中提取CHA2DS2-VASc风险因素.
- 通过利用来自自由文本临床叙述的信息来提高中风风险评估的准确性.
- 为了促进可计算的风险评估,以指导抗凝治疗.
主要方法:
- 使用Llama3.1大型语言模型的RAG架构从1000份临床笔记中提取CHA2DS2-VASc风险因素.
- 两名临床医生手动注释了一组200张笔记,以建立验证的黄金标准.
- 性能评估使用受体操作特征 (AUROC) 下的宏观平均面积,并根据MIMIC-IV数据进行外部验证.
主要成果:
- 在确定高血压,中风/TIA,血管疾病和糖尿病等关键风险因素方面,RAG模型显著优于结构化数据.
- 在专家注释的笔记中,高AUROC (0.96-0.98) 在高血压,糖尿病和75岁以上的年龄中实现.
- 与仅使用结构化数据相比,纳入RAG识别的因素导致CHA2DS2-VASc得分增加.
结论:
- 大语言模型优化RAG准确地从非结构化的AF患者笔记中提取关键的CHA2DS2-VASc风险因素.
- 这种自动化方法可以实现更精确,可计算的风险评估.
- 这些发现支持改善AF患者适当抗凝治疗的指导.


