在内罗毕的一项两阶段发病率调查中,利用机器学习对磨损的决定因素进行建模
Daniel M Mwanga1,2, Isaac C Kipchirchir1, George O Muhua1
1Department of Mathematics, University of Nairobi, Kenya.
Global epidemiology
|February 10, 2025
概括
机器学习有效地预测了研究中的磨损. 关键因素包括接近工业,男性性别和就业,有助于有针对性的后续战略.
科学领域:
- 流行病学 流行病学
- 生物统计学 生物统计学
- 机器学习 机器学习
背景情况:
- 磨损在纵向和多阶段横截面研究的参数估计中构成了重大挑战.
- 预测和理解消耗对于基于人口的健康研究的有效性至关重要.
研究的目的:
- 评估机器学习模型在预测参与者退出方面的实用性.
- 在两阶段发病流行研究中,确定与消耗相关的关键因素.
- 为改善健康研究中参与者随访率的策略提供信息.
主要方法:
- 在内罗毕进行了一项基于人口的发病率的两阶段研究.
- 消耗被定义为可能的病例从I阶段不参加II阶段 (神经科医生评估).
- 机器学习模型,包括随机森林,XGBoost和SVM,经过训练并使用AUC,准确性,Brier分数和F1分数等指标进行评估,并使用SMOTE等技术应用于类不平衡.
主要成果:
- 随机森林,XGBoost和SVM在预测消耗方面表现出很高的表现 (AUC从0.93到0.98不等).
- 发现的重要预测因素包括接近工业区,男性性别,就业状况,教育水平,较小的家庭规模和复杂的部分史.
- 整体超级学习者模型也实现了高预测性能.
结论:
- 机器学习模型可以准确地预测基于人口的健康研究中的消耗.
- 确定关键的消耗预测因素可以开发有针对性的干预措施,以改善参与者保留.
- 研究结果可以为创建预测算法提供信息,以提高类似研究环境中的后续调查率.


