PLMSearch和PLMAlign:基于蛋白语言模型 (PLM) 的同源蛋白序列搜索和对齐
Wei Liu1,2, Ziye Wang1, Ronghui You1
1Institute of Science and Technology for Brain-Inspired Intelligence and MOE Frontiers Center for Brain Science, Fudan University, Shanghai, China.
Methods in molecular biology (Clifton, N.J.)
|July 2, 2025
概括
我们开发了PLMSearch和PLMAlign,这两种新的工具使用蛋白质语言模型 (PLM) 来识别和对准与远距离相关的蛋白质序列. 这些方法增强了进化关系推断,超出了传统的序列和结构搜索.
科学领域:
- 计算生物学是一种计算生物学.
- 生物信息学是一种生物信息学.
- 结构生物学是结构生物学.
背景情况:
- 在计算生物学中,同源蛋白质搜索和序列对齐至关重要.
- 仅仅从序列中推断遥远的进化关系是具有挑战性的.
- 现有的结构搜索方法提供了洞察力,但对仅序列分析有局限性.
研究的目的:
- 介绍基于蛋白质语言模型 (PLM) 的新型工具PLMSearch和PLMAlign.
- 能够准确识别和对准远程同源蛋白质序列.
- 使用序列数据推进进化关系的检测.
主要方法:
- PLMSearch利用预训练的PLM的深度表示,用于基于序列的同源搜索.
- PLMAlign为已识别的同源对提供了准确的序列对齐.
- 这两种工具都利用实体结构相似性的大型数据集进行培训和验证.
主要成果:
- PLMSearch有效地从单独的序列数据中检测远程同质性.
- PLMAlign精确地对齐同源蛋白质序列.
- 提供Web服务器和开源资源,以提供可访问性和进一步研究.
结论:
- PLMSearch和PLMAlign代表了蛋白质序列分析的重大进步.
- 这些基于PLM的工具提高了远程进化关系的检测.
- 自由可用的资源促进了更广泛的采用和科学发现.


