在英国生物银行使用线性和神经网络模型预测常见疾病的蛋白质组风险得分
Alexander Smith1,2, Paul Elliott3,4, Manuel Mayr5
1Department of Epidemiology and Biostatistics, School of Public Health, Imperial College London, London, UK. alexander.smith@imperial.ac.uk.
Scientific reports
|July 2, 2025
概括
使用蛋白质水平的等离子体蛋白质学可以预测27种常见疾病. 机器学习模型提高了疾病预测的准确性,特别是在像帕金森病这样的疾病中,突出了早期检测的蛋白质组学潜力.
科学领域:
- 生物化学 生物化学
- 基因组学就是基因组学.
- 医疗信息学 医疗信息学
背景情况:
- 血蛋白质组学通过分析蛋白质表达模式,为疾病预测提供了一条新的途径.
- 识别蛋白质生物标志物对于提高早期疾病检测和风险分层至关重要.
研究的目的:
- 利用线性和深度学习模型开发和评估蛋白质组风险评分,用于预测27种常见疾病.
- 评估蛋白质组评分的增量预测价值与现有的临床风险因素相比.
- 在各种健康结果中调查共享和独特的蛋白质预测因子.
主要方法:
- 利用了来自53030名英国生物库参与者的2923种蛋白质的数据.
- 使用ElasticNet回归和深度学习神经网络 (NN) 开发了蛋白质组风险评分.
- 通过考克斯回归评估预测性歧视,包括C指数和增量变化 (ΔC指数).
主要成果:
- 蛋白质基因风险得分显示了12种疾病的强烈歧视 (C指数>0.80).
- 在11个结局方面,NN模型的表现优于线性模型,特别是帕金森病 (0.84) 和肺栓塞 (0.83).
- 将蛋白质组分数添加到临床模型中提高了准确性 (ΔC指数0.03),对9种疾病 (ΔC指数>0.1) 有显著的收益.
结论:
- 蛋白质组学显著提高了疾病风险预测,特别是在非线性关系很重要的复杂疾病中.
- 根据特定疾病量身定制预测模型,并利用神经网络等先进方法,可以最大限度地提高预测能力.
- 蛋白质组风险评分是促进疾病风险分层并使早期检测成为可能的关键工具.


