XGB-BIF:一种XGBoost驱动的生物标志物识别框架,用于使用人类基因组数据检测癌症
Veena Ghuriani1, Jyotsna Talreja Wassan1, Priyal Tripathi1
1Maitreyi College, University of Delhi, New Delhi 110021, India.
International journal of molecular sciences
|June 26, 2025
概括
这项研究介绍了XGB-BIF,这是一种机器学习框架,可以识别胃,肺和乳腺癌的关键基因组生物标志物. 该方法在区分患病状态和非患病状态方面达到90%以上的准确性,有助于开发有针对性的治疗方法.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 机器学习 机器学习
背景情况:
- 人类基因组在健康和疾病中发挥着关键作用,癌症检测和向治疗需要先进的分析方法.
- 识别特定的基因组生物标志物对于有效的癌症诊断和治疗策略至关重要.
研究的目的:
- 开发和验证机器学习框架 (XGB-BIF) 以识别与胃癌,肺癌和乳腺癌相关的基因组生物标志物.
- 通过基因组数据分析,增强疾病检测和分层癌症风险.
主要方法:
- 使用XGBoost驱动生物标志物识别框架 (XGB-BIF) 来分析癌症患者的人类基因组数据.
- 通过XGBoost (eXtreme Gradient Boosting) 进行特征选择,以捕捉复杂的特征交互.
- 使用支持矢量机 (SVM),物流回归 (LR) 和随机森林 (RF) 模型进行分类.
- 通过夏普利添加式解释 (SHAP) 和局部可解释的模型不可知解释 (LIME) 的解释性.
- 使用途径丰富和生存分析 (卡普兰-梅尔曲线,考克斯回归) 验证生物标志物的意义.
主要成果:
- XGB-BIF框架实现了高预测性能,在分类癌症状态时具有>90%的准确性.
- 预测和实际风险类别之间的强烈一致性得到了科恩的卡帕统计数据 (0.80-0.99) 的证实.
- 对METABRIC数据集的外部验证结果为AUC-ROC为93%,准确率为79%,卡帕为74%.
- 鉴定胃癌 (例如CBX2,CLDN1),乳腺癌 (例如CAVIN2,ADAMTS5) 和肺癌 (例如CLDN18,MYBL2) 的特定高影响生物标记基因.
结论:
- XGB-BIF有效地识别了不同癌症类型的基因组生物标志物,证明了翻译价值.
- 鉴定的生物标志物可以显著帮助临床医生开发针对癌症患者的向疗法.
- 该框架为使用基因组数据发现生物标志物提供了强大的方法,改善了癌症检测和风险分层.


