MSTL-Kace:基于多阶段转移学习策略预测 Prokaryotic Lysine 乙化位
Gang-Ao Wang1, Xiaodi Yan1, Xiang Li1
1School of Sciences, Anhui Agricultural University, Hefei 230036, Anhui, China.
ACS omega
|November 16, 2023
概括
我们开发了MSTL-Kace,这是一个新的机器学习模型,用于预测 lysine 乙化 (Kace) 位点. 该模型使用转移学习和BERT嵌入来提高准确性,特别是对于数据有限的物种.
科学领域:
- 生物化学 生物化学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 素乙化 (Kace) 是一种关键的翻译后修饰 (PTM),涉及到各种生物过程.
- 传统的实验Kace站点识别是艰苦而昂贵的.
- 现有的机器学习方法经常在特征表示和小样本大小方面扎.
研究的目的:
- 开发一个准确和高效的计算模型来预测氨酸乙化位点.
- 为了解决凯斯预测中手工制作的特征和小样本问题的局限性.
- 为了利用转移学习和深度学习来提高蛋白质修饰部位的预测.
主要方法:
- 提出了MSTL-Kace,这是一种采用转移学习与预训练的变压器双向编码器表示 (BERT) 的新型模型.
- 使用特定物种的BERT模型提取的高水平残留物嵌入物.
- 实施了两阶段的微调策略,以管理小样本数据挑战.
- 利用随机森林作为下游学习算法,以在六种 prokaryotic 物种上获得最佳性能.
主要成果:
- 与最先进的方法相比,MSTL-Kace在所有六种 prokaryotic 种类的独立测试集上表现出优越的性能.
- 该模型通过深度学习嵌入有效地捕获复杂的生物信息.
- 两阶段微调方法成功缓解了与有限的数据可用性相关的问题.
结论:
- MSTL-Kace在计算Kace站点预测方面取得了重大进展.
- 转移学习策略有效地提高了预测准确性,特别是在代表性不足的物种.
- 开发的模型为生物研究提供了有价值的工具,需要有效地识别凯斯遗址.
更多相关视频
12:49Quantification of Site-specific Protein Lysine Acetylation and Succinylation Stoichiometry Using Data-independent Acquisition Mass Spectrometry
Published on: April 4, 2018
11.6K
07:26Site Specific Lysine Acetylation of Histones for Nucleosome Reconstitution using Genetic Code Expansion in Escherichia coli
Published on: December 26, 2020
4.0K
