用于肺癌风险预测的多模型机器学习框架:对使用行为和血液学参数的混合和整体方法的九个分类器进行比较分析
Vinod Kumar1, Chander Prabha2, Deepali Gupta2
1Chandigarh University, Mohali, India.
SLAS technology
|June 25, 2025
概括
机器学习模型有效地使用人口,行为和血液学数据预测肺癌 (LC) 风险. 混合模型对早期LC检测和个性化干预有前途.
科学领域:
- 在瘤学瘤学.
- 计算生物学 计算生物学
- 数据科学数据科学数据科学
背景情况:
- 肺癌 (LC) 仍然是全球癌症死亡的主要原因,需要先进的检测方法.
- 早期识别和风险分层对于改善患者治疗结果和公共卫生干预措施至关重要.
研究的目的:
- 评估各种机器学习 (ML) 算法的肺癌风险预测性能.
- 确定导致LC风险的关键人口,行为和血液学因素.
- 探索混合ML模型对临床转化和早期诊断的实用性.
主要方法:
- 在2000个患者记录的数据集上对9个ML算法 (KNN,AdaBoost,LR,RF,SVM,NB,DT,GB,SGD) 进行了比较分析.
- 使用准确度,灵敏度,特异性,F1得分和曲线下的面积 (AUC) 来评估性能.
- 组合方法和回归技术 (Lasso,Ridge) 用于提高预测能力和可解释性.
主要成果:
- 渐变增强 (GB) 获得了最高的F1得分 (0.953) 和灵敏度 (99.1%).
- KNN-AdaBoost混合模型的准确度最高 (99.5%),而随机森林 (RF) 的AUC值最高 (0.92).
- 合并方法通过整合各种模型优势,表现出强的性能.
结论:
- 结合行为和生物数据的混合ML模型为预测LC风险提供了强大的方法.
- 这些模型可以集成到电子健康记录中,用于早期查,风险分层和有针对性的公共卫生计划.
- 结合成像和基因组数据的未来研究可以进一步提高预测能力和个性化治疗策略.


