基于机器学习的蛋白质基因组数据建模识别了循环等离子体生物标志物,用于早期检测肺癌
Marcela A Johnson1,2,3, Shirley Nieves-Rodriguez1, Liping Hou1
1Population Analytics & Insights, DPDS, Data Sciences & Digital Health, Johnson & Johnson, Spring House, PA, USA.
Communications medicine
|March 14, 2026
概括
研究人员确定了血液中的关键蛋白质,这些蛋白质在肺癌诊断之前就发生了改变. 这些发现可能会导致新的早期检测生物标志物用于肺癌查和风险分层.
科学领域:
- 在瘤学瘤学.
- 蛋白质组学是指蛋白质组学.
- 基因组学就是基因组学.
背景情况:
- 遗传异常是肺癌的主要驱动因素.
- 了解基因组-蛋白质组相互作用对于早期诊断和有效治疗至关重要.
- 种群层面的蛋白质组失调需要进一步调查,以发现生物标志物.
研究的目的:
- 调查肺癌风险的全基因组关联研究 (GWAS).
- 检查肺癌风险变异对血蛋白水平的影响.
- 使用机器学习识别早期诊断生物标志物的血蛋白质组调节障碍.
主要方法:
- 对肺癌进行了全基因组关联研究 (GWAS).
- 分析了与肺癌风险变异相关的血蛋白水平,使用英国生物银行制药保护学项目的数据.
- 利用机器学习来识别前症状和症状肺癌患者的血蛋白质组失调.
主要成果:
- 机器学习模型实现了高AUC (0.80-0.88) 在诊断前9年预测肺癌.
- 八种蛋白质 (例如,CALCB,PLAUR,CD74) 的水平升高与较低的存活率显著相关.
- 确定了22种与疾病相关的蛋白质,包括8种新型蛋白质,富含诸如细胞因子信号传递和肺纤维化等途径.
结论:
- 蛋白质基因变化在肺癌诊断之前发生,这表明系统性变化.
- 这些发现突出了肺癌早期检测的潜在循环蛋白质.
- 该研究促进了对肺癌中基因组-蛋白质组关系的理解,用于生物标志物开发.


