NCSP-PLM:基于蛋白质语言模型和深度学习的组合学习框架,用于预测非经典分泌蛋白质
Taigang Liu1, Chen Song1, Chunhua Wang1
1College of Information Technology, Shanghai Ocean University, Shanghai 201306, China.
Mathematical biosciences and engineering : MBE
|February 2, 2024
概括
我们开发了NCSP-PLM,这是一种使用蛋白质语言模型和深度学习的计算工具,用于准确识别非经典分泌蛋白 (NCSPs). 这种方法增强了对细胞间通信和蛋白质分泌机制的理解.
科学领域:
- 蛋白质组学和生物信息学
- 分子生物学和生物化学 分子生物学和生物化学
背景情况:
- 非经典分泌蛋白 (NCSPs) 对于细胞间通信至关重要,但缺乏信号,使其识别复杂化.
- 对于NCSP识别的实验方法是艰苦而昂贵的,需要高效的计算方法.
研究的目的:
- 开发和评估用于识别非经典分泌蛋白 (NCSPs) 的准确计算方法.
- 利用预训练的蛋白质语言模型 (PLM) 和集体深度学习来增强NCSP预测.
主要方法:
- 一个集体学习框架,NCSP-PLM,是使用9个PLM的功能嵌入设计的.
- 深度学习模型 (MLP,注意力,BiLSTM) 通过加权投票进行了微调和整合.
- 使用5倍交叉验证和独立测试集验证了性能.
主要成果:
- 在基准数据集上,NCSP-PLM实现了高性能.
- 该模型在独立的测试组中显示出91.18%的灵敏度和97.06%的特异性.
- 总体准确率达到94.12%,显著超过现有的最先进的预测器的7-16%.
结论:
- NCSP-PLM提供了一个强大的,准确的计算工具来识别NCSPs.
- 这些发现有助于更深入地了解NCSP分泌机制及其在细胞过程中的作用.
- 这种方法有助于在生物研究中对NCSP进行大规模注释.


