血液ProST:通过自我训练来预测血液分泌蛋白质
Xuechen Mu1,2,3,4, Long Xu1,2,3, Zhenyu Huang1,2,3,5
1Key University Laboratory of Metabolism and Health of Guangdong, Southern University of Science and Technology, Shenzhen 518055, China.
Briefings in bioinformatics
|August 1, 2025
概括
我们开发了BloodProST,这是一种机器学习工具,可以通过自我训练准确预测血液分泌蛋白质. 这种方法通过克服对诊断和治疗点的标记数据的局限性来增强生物标记物的发现.
科学领域:
- 生物化学 生物化学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 精确识别血液分泌蛋白质对于生物标志物发现和治疗标识别至关重要.
- 有限的实验验证数据集阻碍了强大的预测模型的开发.
研究的目的:
- 推出BloodProST,这是一种新的机器学习框架,用于可靠地预测血液分泌蛋白质.
- 通过自我培训策略来应对稀缺标记数据的挑战.
主要方法:
- 血液ProST使用自训练方法来扩展标记数据集,从未标记的蛋白质序列中使用高可靠性伪标签.
- 基于差异演变的无监督特征选择模块优化了蛋白质特征识别.
- 双路CNN-LSTM架构捕获本地和顺序蛋白质信息,将生物先验集成到损失函数中.
主要成果:
- 在预测准确性,稳定性和可解释性方面,BloodProST显著超过了14个最先进的模型.
- 验证证实了使用分泌标记物的预测的生物学相关性,并证明了对其他生物流体 (如尿液) 的概括性.
- 自训练策略可以提高模型性能,而无需持续的手动注释.
结论:
- 血液ProST提供了一种多功能计算工具,用于预测蛋白质分泌和发现各种生物流体中的生物标志物.
- 该框架有效地克服了秘密研究中的数据稀缺问题.
- 这种方法在推进诊断和治疗方面具有重大潜力.


