风险因素及其变量类型在使用人工智能算法预测噪音引起的听力损失中的作用
Zhengheng Zhang1, Longteng Jiang2, Meibian Zhang1
1Chinese Center for Disease Control and Prevention, National Institute of Occupational Health and Poison Control, Beijing, China.
Hearing research
|July 6, 2025
概括
机器学习模型有效地使用连续风险因素预测职业噪音引起的听力损失 (NIHL). 连续变量和像LGBM这样的算法为NIHL提供了卓越的预测准确性.
科学领域:
- 职业健康 职业健康 职业健康
- 生物统计学 生物统计学
- 机器学习在医学中的应用
背景情况:
- 职业噪音引起的听力损失 (NIHL) 对工人的健康构成重大风险.
- 早期预测和预警系统对于减轻NIHL至关重要.
- 机器学习 (ML) 为开发先进的预测模型提供了潜力.
研究的目的:
- 使用ML技术探索NIHL各种风险因素及其变量类型的预测作用.
- 在NIHL预测中比较不同ML算法 (逻辑回归,RF,XGBoost,LGBM,TabNet) 的性能.
- 评估使用连续变量与分类变量类型对预测准确性的影响.
主要方法:
- 利用来自中国国家职业病监测计划和现场测量的15160名工人的数据.
- 开发并比较使用后勤回归,随机森林,XGBoost,LGBM和Tab.Net的预测模型.
- 评估了八个关键特征:年龄,性别,噪音暴露时间,LAeq,8h,kurtosis,血压和HPD使用,使用原始和分类变量类型.
主要成果:
- 多变量逻辑回归确定了年龄,噪声暴露时间,LAeq,8h,性别和HPD使用量作为重要的NIHL预测因素 (P <0.05).
- 使用连续变量的ML模型 (基于树和TabNet) 的表现明显优于使用分类变量的ML模型 (P < 0.05).
- 连续变量的LGBM模型实现了0.745的最高AUC,其中LAeq,8h,性别,年龄和化被确定为关键预测特征.
结论:
- 与分类类型相比,连续变量类型的风险因素为NIHL提供了更好的预测价值.
- 基于树的算法 (RF,XGBoost,LGBM) 和TabNet是有效的评估和预测NIHL.
- 机器学习模型显示了NIHL早期预测和职业环境中的干预的巨大潜力.


