用于心脏外科手术的机器学习模型中的性能偏差风险预测:回顾性分析
Tim Dong1, Shubhra Sinha1, Ben Zhai2
1Bristol Heart Institute, Translational Health Sciences, University of Bristol, Bristol, United Kingdom.
JMIRx med
|June 18, 2024
概括
用于心脏手术风险预测的机器学习模型显示,由于数据集漂移,随着时间的推移,性能下降. 极端梯度增强和随机森林模型的表现超过了像EuroSCORE II.这样的传统分数.
科学领域:
- 心血管外科心血管外科
- 医疗信息学 医疗信息学
- 医疗保健中的机器学习
背景情况:
- 对于成人心脏手术死亡率的传统风险评分 (例如,EuroSCORE II) 容易发生校准错误和不良概括.
- 数据集的漂移,即部署的ML模型遇到与其训练数据不同的数据,阻碍了ML在临床实践中的采用.
- 了解ML模型中的性能漂移对于它们在现实世界医疗保健环境中的可靠应用至关重要.
研究的目的:
- 评估机器学习 (ML) 模型中的性能漂移程度,以随着时间的推移预测心脏手术风险.
- 调查数据集漂移和变量重要性漂移对模型性能的影响.
- 将ML模型的性能漂移与EuroSCORE II风险评分进行比较.
主要方法:
- 对从227,087名成年患者前性收集的英国心脏手术数据 (2012-2019) 的回顾性分析.
- 与EuroSCORE II一起开发和时间验证五种新的ML死亡率预测模型.
- 使用共识指标评估变量重要性偏移,性能偏移和数据集偏移之间的关系.
主要成果:
- 在所有模型中观察到整体性能显著下降 (P<.0001).
- 极端梯度增强 (CEM 0.728) 和随机森林 (CEM 0.727) 显示出最好的性能.
- EuroSCORE II表现最差;变量重要性和数据集漂移的急剧变化与性能下降相关.
结论:
- 所有评估的模型都经历了随着时间的推移的性能退化,突出显示了数据集漂移的影响.
- 变量重要性漂移检测强调了后勤回归的局限性和数据集漂移在心脏手术风险预测中的影响.
- 需要进一步的研究来探索组合ML模型,以潜在地提高性能和稳定性.


