预测和解释来自胰癌和单细胞转录组的蛋白质和蛋白丰度
Hui-Mei Tsai1,2,3, Tzu-Hung Hsiao2,4,5, Yu-Chiao Chiu6,7
1Graduate Institute of Biomedical Electronics and Bioinformatics, National Taiwan University, Taipei 106319, Taiwan.
iScience
|March 12, 2026
概括
深度学习模型DeepGxP从RNA表达数据准确预测蛋白质的丰富性. 这通过解码基因与蛋白质的关系来推进癌症生物标记物的发现.
科学领域:
- 计算生物学是一种计算生物学.
- 基因组学就是基因组学.
- 蛋白质组学是指蛋白质组学.
- 癌症研究 癌症研究
背景情况:
- RNA表达是蛋白质丰富性的不足代理,阻碍了表型和疾病研究.
- 准确的蛋白质丰度预测对于理解生物过程和疾病机制至关重要.
研究的目的:
- 开发一个深度学习模型 (DeepGxP) 来从转录组资料中预测蛋白质丰度.
- 创建一个解释框架 (DeepEnrich) 来识别基因预测因子和丰富的功能.
- 探索DeepGxP在癌症生物标志物发现和细胞识别中的实用性.
主要方法:
- 在癌症基因组图谱 (TCGA) 全癌症数据上训练了DeepGxP.
- 利用基于梯度的集成解释框架 (DeepEnrich) 来实现模型的可解释性.
- 使用Pearson的相关性和预测性绩效指标,与传统模型对比验证了DeepGxP的性能.
主要成果:
- DeepGxP实现了0.68的平均皮尔森相关性,超过了传统模型的表现.
- 预测性表现为高自我基因/蛋白质相关性为0.74和低相关性为0.64.
- 确定了特定的基因预测因子,并为像B1和E2环林等蛋白质增强了功能.
- 在肺腺癌中发现了独特的EGFR/HER2酸化模式,并将p53蛋白与乳腺癌的存活率联系起来.
- 准确预测单细胞表面蛋白质丰富度用于细胞识别.
结论:
- DeepGxP有效地从转录组数据中预测蛋白质的丰富性,比现有方法提供了显著的改进.
- DeepEnrich提供了对基因-蛋白质关系和生物功能有价值的见解.
- DeepGxP对推进癌症生物标志物发现和理解复杂的生物系统具有巨大的潜力.


