相关实验视频
Updated: Jun 14, 2025

12:00
A Practical Guide to Phylogenetics for Nonexperts
Published on: February 5, 2014
35.3K
learnMSA2:深度蛋白质多重对齐与大语言和隐藏的马尔科夫模型
1Institute of Mathematics and Computer Science, University of Greifswald, 17489 Greifswald, Germany.
Bioinformatics (Oxford, England)
|September 4, 2024
概括
learnMSA2,一种新的蛋白质序列对齐器,使用深度学习嵌入来提高准确性,特别是对于低身份序列. 这种生物信息学工具对大型数据集的现有方法具有显著的优势.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
背景情况:
- 传统的蛋白质序列对齐工具在序列认同减少或数据集大小增加时难以准确.
- 现有的方法往往使用有限的先前知识和数据,影响其在具有挑战性的对齐上的性能.
研究的目的:
- 开发一种改进的蛋白序列对齐方法,利用深度学习嵌入.
- 为了提高大和多样化的蛋白质家族的多个序列对齐的准确性和可扩展性.
主要方法:
- 扩展了传统的隐藏马尔科夫模型 (HMM) 扩展了传统的隐藏马尔科夫模型 (HMM),以整合来自深度学习模型的蛋白质序列嵌入.
- 利用梯度下降和可差异化的HMM层进行模型装配.
- 联合对齐的未对齐的蛋白质序列及其嵌入到蛋白质家族模型中.
主要成果:
- 基于HMM的升级对齐器,学习MSA2,与ProtT5-XL蛋白质语言模型相结合,与最先进的竞争对手相比,在正确对齐的列中平均达到近6%的更高精度.
- learnMSA2在较低的序列标识和较多的序列数量方面表现出卓越的性能.
- 这种方法可以随着序列数的增加而很好地扩展.
结论:
- 蛋白质语言模型的嵌入包含丰富的进化,结构和生物物理信息,对生物信息学任务有价值.
- learnMSA2代表了多个序列对齐的重大进步,特别是在具有挑战性的数据集.
- 这些发现突出了深度学习嵌入的潜力,以推动生物信息学下游应用.

