在泛癌风险风险风险预测模型中的新型机器学习算法:在大型前性队列中的应用
Xifeng Wu1,2,3,4,5, Huakang Tu1,2, Qingfeng Hu1
1Department of Big Data in Health Science School of Public Health, and Center of Clinical Big Data and Analytics of The Second Affiliated Hospital, Zhejiang University School of Medicine, Hangzhou, Zhejiang, China.
BMJ oncology
|January 31, 2025
概括
机器学习模型使用亚洲人的常规健康数据预测泛癌风险. XGBoost模型显示了良好的准确性,识别了具有显著增加癌症发病率的高风险个体.
科学领域:
- 在瘤学瘤学.
- 生物信息学是一种生物信息学.
- 公共卫生 公共卫生
背景情况:
- 预测泛癌发病率对于早期检测和预防策略至关重要.
- 利用例行健康检查数据为大群体的风险评估提供了可扩展的方法.
研究的目的:
- 开发和验证用于预测泛癌发病率风险的机器学习模型.
- 在一个大规模的亚洲群体中利用人口统计,问卷和例行健康检查数据.
主要方法:
- 一项前性队列研究,对433,549名参与者 (男性和女性队列) 进行了8年的中位数随访.
- 机器学习模型的开发和比较,包括XGBoost,Lasso-Cox和随机生存森林.
- 使用曲线下的面积 (AUC) 评估模型性能,并确定关键预测变量.
主要成果:
- 与其他模型相比,XGBoost在预测胰腺癌发病率方面表现优越.
- 使用较少变量的优化模型 (男性31个,女性11个) 保持了高的预测准确度 (AUC从0.746到0.876不等).
- 通过模型识别的高风险个体的胰腺癌发病率风险至少增加了9倍.
结论:
- 该研究成功开发并内部验证了用于使用常规健康数据预测胰腺癌风险的机器学习模型.
- 这些模型表现出良好的区分能力与节的一组预测器.
- 建议在临床实施风险预测模型之前进行外部验证.


