基于NHANES数据库的机器学习模型的开发和验证,以预测基于NHANES数据库的中风风险
1Department of General Surgery, Lianjiang Traditional Chinese Medicine Hospital, Zhanjiang, Guangdong, China.
Medicine
|November 8, 2025
概括
机器学习模型使用国家健康和营养检查调查数据准确预测中风风险. 不同的变量选择方法影响预测准确性,突出了临床应用的潜力.
科学领域:
- 医疗信息学医学信息学
- 生物统计学 生物统计学
- 公共卫生 公共卫生
背景情况:
- 脑卒中对全球健康造成重大负担,发病率和死亡率高.
- 准确的中风风险评估对于有效的预防和临床管理至关重要.
- 机器学习为提高医疗保健中的预测能力提供了有前途的工具.
研究的目的:
- 评估机器学习模型对中风风险预测的有效性.
- 在开发预测模型时比较不同的变量选择技术.
- 用强大的分析方法识别中风的关键预测因素.
主要方法:
- 利用了来自国家健康和营养检查调查 (1999-2002) 的数据.
- 应用了LASSO回归与逐步选择,随机森林和Boruta算法与LASSO回归用于变量选择和模型构建.
- 使用接收器操作特征 (ROC) 曲线,精度回忆曲线,校准和决策曲线分析评估模型性能.
主要成果:
- 一个LASSO和逐步回归模型表现出强大的区分性能,曲线下的面积 (AUC) 为0.843.
- 波鲁塔算法随后通过LASSO回归实现了0.828.8的可比AUC.
- 随机森林产生较低的预测准确度 (AUC = 0.612),选择的预测因素较少.
结论:
- 不同的变量选择方法显著影响中风风险模型的预测准确性.
- 机器学习模型,特别是使用LASSO和Boruta算法的机器学习模型,在预测中风风险方面具有很高的准确性和临床价值.
- 利用NHANES数据库开发的模型为预测中风风险提供了可靠的工具,有助于预防和干预策略.


