机器学习框架来提取血IgG N-glycans的生物标志物潜力,以实现疾病风险分层
Konstantinos Flevaris1, Joseph Davies1, Shoh Nakai1
1Department of Chemical Engineering, Imperial College London, London SW7 2AZ, United Kingdom.
Computational and structural biotechnology journal
|March 29, 2024
概括
这项研究引入了一种机器学习框架,用于分析IgG N-glycans用于结直肠癌 (CRC) 生物标志物发现. 该框架成功识别了IgG N-glycan配置文件,可以帮助根据CRC风险对患者进行分层.
科学领域:
- 生物化学 生物化学
- 计算生物学 计算生物学
- 在瘤学瘤学.
背景情况:
- 慢性病和癌症管理需要有效的生物标志物来进行早期查和诊断.
- 人体血中的免疫球蛋白G (IgG) N-甘氨酸是有希望的,由于它们对各种刺激的动态反应,它们是最小侵入性的生物标志物.
- 机器学习 (ML) 和数据分析对于释放IgG糖因子在生物标志物发现中的潜力至关重要.
研究的目的:
- 为构建,优化和评估ML管道提出和评估基于ML的N-糖体分析框架.
- 根据IgG N-glycan数据,以可解释的方式根据疾病风险对患者进行分层.
- 确定影响结肠直肠癌 (CRC) 分类决策的关键IgG N-甘氨酸.
主要方法:
- 利用了从苏格兰结直肠癌研究 (SOCCS) 队列中公布的结直肠癌 (CRC) 数据集.
- 开发并测试了一种ML框架,使用XGBoost管道,多目标优化,用于校准的感应Venn-Abers预测器 (IVAP) 和嵌套交叉验证 (NCV).
- 应用累积局部效应 (ALE) 用于模型不可知解释性来识别显著的IgG N-glycans.
主要成果:
- 一个优化的XGBoost ML管道在将CRC患者与健康对照进行分类时,实现了0.771的接受器操作特征曲线 (AUC-ROC) 下的平均面积.
- 该研究表明,IgG N-甘氨酸相对丰富的潜力可以用于识别CRC风险较高的个体.
- 影响CRC分类的关键IgG N-甘氨酸被使用ALE识别,提供了对生物标志物相关性的见解.
结论:
- 拟议的ML框架提供了一种强大的方法,用于将基于甘氨酸的生物标志物转化为临床应用.
- IgG N-glycans显示出作为微创生物标志物的显著潜力,用于早期检测和结直肠癌风险分层.
- 可解释的ML模型对于理解生物标志物贡献和促进临床采用至关重要.


