一个机器学习模型用于从行政数据中预测先天性心脏缺陷
Haoming Shi1, Wendy Book2,3, Cheryl Raskind-Hood3
1Department of Biomedical Engineering, Georgia Institute Technology, Atlanta, Georgia, USA.
Birth defects research
|September 8, 2023
概括
机器学习 (ML) 算法显著提高了在行政数据中识别先天性心脏缺陷 (CHD) 的准确性,而不是仅使用国际疾病分类 (ICD) 代码. 这有助于加强对心血管疾病患者的公共卫生监测.
科学领域:
- 医疗信息学 医疗信息学
- 公共卫生 公共卫生
- 机器学习 机器学习
背景情况:
- 国际疾病分类 (ICD) 代码通常用于在行政数据中识别先天性心脏缺陷 (CHD).
- 然而,ICD代码可能会不准确地识别患有心脏病的真实阳性 (TP) 个体,从而可能削弱监测工作.
研究的目的:
- 通过使用机器学习 (ML) 算法在行政记录中准确识别TP CHD病例来加强CHD监测.
- 在大型行政数据集中确定预测TP CHD个体的关键特征.
主要方法:
- 应用传统的ML模型 (逻辑回归,高斯天真贝叶斯,随机森林,XGBoost) 对779名患者的验证数据集.
- 在四个美国地点利用了接触级数据,包括2011-2013年的ICD-9-CM和CPT代码.
- 采用五倍交叉验证来识别重叠的重要特征,并使用PPV和F1-score等指标比较模型性能.
主要成果:
- 专家临床医生对ICD-9-CM CHD代码的验证产生了76.5%的基线积极预测值 (PPV).
- ML特征选择将7138个特征减少到10个,显著改善了TP CHD病例的预测.
- 极端梯度提升 (XGBoost) 显示出卓越的性能,达到0.94的PPV中位数 (95%CI:0.94,0.95) 和0.84的F1得分 (95%CI:0.76,0.91).
结论:
- 与单独使用ICD代码相比,ML算法大大提高了识别TPCHD病例的准确性.
- 这种ML方法提高了从大型数据集到心脏病患者群体的发现的概括性.
- 改进的识别准确性加强了对先天性心脏缺陷的公共卫生监测.


