平衡行为:解决机器学习中的数据不平衡问题,以预测2型糖尿病中心肌梗塞的发生
Berk Ozturk1, Tom Lawton1,2, Stephen Smith1
1University of York, York, YO10 5GH, UK.
Studies in health technology and informatics
|August 23, 2024
概括
在预测2型糖尿病 (T2D) 和心脏病发作 (心肌梗塞) 等并发症的机器学习模型中,可以克服类不平衡. 类权重 (CW) 显著改善了模型性能,为T2D患者的早期风险检测提供了有希望的方法.
科学领域:
- 医疗信息学 医疗信息学
- 心脏病学 心脏病学
- 机器学习 机器学习
背景情况:
- 2型糖尿病 (T2D) 影响全球超过5亿成年人,增加严重并发症的风险.
- 心肌梗塞 (MI) 或心脏病发作是与T2D相关的危急和危及生命的并发症.
- 在T2D患者中准确预测MI对于及时干预和改善患者结果至关重要.
研究的目的:
- 研究类失衡处理 (CIH) 技术对机器学习 (ML) 模型性能对T2D患者预测MI的影响.
- 评估过量采样,不足采样和类权重 (CW) 在应对阶级不平衡挑战中的有效性.
- 确定最有效的CIH技术,以提高ML模型在临床预测任务中的准确性.
主要方法:
- 利用连接的布拉德福德数据集,包含超过一百万个现实世界的健康记录.
- 应用了三种常见的CIH技术:过量抽样,不足抽样和类权重 (CW).
- 在各种ML模型中评估CIH技术,包括天真贝斯 (NB),神经网络 (NN),随机森林 (RF),支持矢量机器 (SVM) 和合集模型.
主要成果:
- 与其他CIH技术相比,类权重 (CW) 显示出更高的性能.
- 在评估的方法中,CW获得了最高的精度 (0.9948) 和F1得分 (0.9556).
- 系统地应用CIH技术显著改善了ML模型在T2D中预测MI的性能.
结论:
- 有效的CIH技术,特别是CW,可以显著提高ML模型对临床预测的可靠性和准确性.
- 在使用真实世界医疗保健数据的ML模型中实施适当的CIH策略显示,在T2D患者中减少心脏病发作风险显著有前途.
- 这项研究强调了解决阶级不平衡对于在医疗保健中可靠的人工智能部署的重要性.


