提高死亡原因预测:开发和验证机器学习模型使用多式联络数据在多个医疗保健站点跨越多式联络数据
Mohammed Al-Garadi1, Rishi J Desai2, Kerry Ngan2
1Department of Biomedical Informatics, Vanderbilt University Medical Center, Nashville, TN 37203, United States.
JAMIA open
|February 23, 2026
概括
机器学习模型使用医院内的电子健康记录准确预测死亡原因. 然而,由于数据的变化,这些模型在不同的医疗保健系统中显示出有限的概括性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的机器学习
- 预测分析是一种预测分析.
背景情况:
- 准确预测死亡原因对于公共卫生监测和临床研究至关重要.
- 电子健康记录 (EHR) 包含大量的数据,可以用于预测建模.
- 现有的CoD确定方法通常依赖于手动审查,这可能耗时且容易变化.
研究的目的:
- 开发和验证机器学习 (ML) 模型,用于预测可能的死亡原因 (CoD).
- 评估结构化EHR数据,非结构化临床笔记和公开可用的Cod预测来源的实用性.
- 评估ML模型在不同医疗机构的通用性.
主要方法:
- 一项回顾性研究涉及两个大型医疗保健系统 (范德比尔特大学医学中心和马萨诸塞州布里格姆总医院) 的已故患者.
- 开发使用结构化EHR数据,非结构化临床笔记和公开可用的数据的XGBoost模型.
- 使用受体运行特征曲线 (AUC) 下的加权面积和F-量度进行性能评估,并进行跨机构验证.
主要成果:
- 仅使用结构化EHR数据的模型实现了0.86 (VUMC) 和0.80 (MGB) 的加权AUC.
- 整合非结构化临床笔记显著改善了性能,达到0.90 (VUMC) 和0.92 (MGB) 的加权AUC.
- 公开可用的数据没有提高预测性能,跨机构验证显示性能大幅下降.
结论:
- 整合结构化和非结构化电子健康记录数据的ML模型在个别机构内显示出强大的预测能力.
- 在跨机构验证过程中观察到显著的绩效下降,这表明有限的概括性.
- 医疗机构应该考虑开发适合本地定制的ML模型来预测CoD,未来的研究应该专注于改善跨不同数据环境的模型通用性.
