BPA:一种基于BERT的优先注释策略,用于评估水生藻类蛋白序列的合理性
Rui-Hua Huang1, Jun-Ze Liang1, Zheng-Hua Sun1
1MOE Key Laboratory of Tumor Molecular Biology and State Key Laboratory of Bioactive Molecules and Druggability Assessment, Guangdong Basic Research Center of Excellence for Natural Bioactive Molecules and Discovery of Innovative Drugs, College of Life Science and Technology, Jinan University, No. 601, West Huangpu Avenue, Guangzhou 510632, China.
Briefings in bioinformatics
|August 12, 2025
概括
基于BERT的蛋白质注释 (BPA) 优化了研究不足的物种的蛋白质基因数据库. 这种深度学习方法显著减少了数据库的大小,同时保持了高蛋白质识别准确度,有助于水生藻类研究.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 基于质谱的蛋白质组学依赖于全面的参考数据库来识别蛋白质.
- 水生藻类物种往往缺乏注释基因组,需要转录组的六翻译,从而创建了大量的冗余数据库.
- 现有的蛋白质组构造方法在数据库大小和搜索空间效率方面面临挑战.
研究的目的:
- 引入基于BERT的蛋白质注释 (BPA),这是一个新的深度学习策略,用于优化参考蛋白质组结构.
- 提高蛋白质基因数据库搜索的效率和可扩展性,特别是对基因组研究不足的物种.
- 开发一种基于序列可靠性的蛋白质组数据适应性过方法.
主要方法:
- BPA集成了一个预训练的BERT模型用于上下文模式,伪氨基酸组成用于物理化学性质,以及InterProScan用于功能域预测.
- 使用随机森林分类器来生成动态序列可靠性得分.
- 这种方法使得适应性过门能够适应各种实验设计.
主要成果:
- 在三种测试物种中,BPA表现强,分类准确度高 (AUC > 0.95).
- 对Karenia mikimotoi的应用导致90%的蛋白质组压缩,识别覆盖率为40%.
- 该方法有效地解决了在大型数据库中冗余翻译引起的含糊性.
结论:
- BPA提供了一个可扩展和有效的框架,用于构建和优化参考蛋白质组图书馆.
- 这一战略有助于改善水生藻类和其他具有有限基因组信息的物种的蛋白质组研究.
- 开发的工具解决了新的蛋白质结构中大搜索空间的挑战.


