使用蛋白质大语言模型的语义搜索检测了细菌基因组中的II类微蛋白
Anastasiya V Kulikova1, Jennifer K Parker2, Bryan W Davies2,3
1Department of Integrative Biology, The University of Texas at Austin, Austin, Texas, USA.
mSystems
|September 18, 2024
概括
蛋白质语言模型可以比传统方法更有效地识别新型II类微,一种类型的抗微生物. 这种方法有助于发现新的抗生素,以对抗日益增长的抗菌素耐药性.
科学领域:
- 微生物学 微生物学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 第二类微是抗菌,有可能成为新型抗生素.
- 新的II类微蛋白的发现受其短长度和序列分歧的限制.
- 现有的基于序列的方法,如BLAST,难以识别分离的微蛋白.
研究的目的:
- 调查蛋白质大语言模型 (LLM) 在细菌基因组中检测II类微蛋白的实用性.
- 为了比较基于LLM的嵌入与基于序列的微发现方法的有效性.
- 使用LLM嵌入式识别新型假定II类微蛋白.
主要方法:
- 使用LLMs生成蛋白质的数值嵌入.
- 应用这些嵌入式来搜索细菌基因组组件的微蛋白.
- 将基于嵌入式检测与BLAST搜索的性能进行比较.
- 分析了来自大肠杆菌,克莱布西拉和恩特罗巴克特的基因组数据.
主要成果:
- 在可靠检测已知的II类微蛋白方面,LLM嵌入显著优于BLAST.
- 高度序列分离的微在嵌入空间中表现出小距离.
- 在 *E. coli*, *Klebsiella* spp. 和 *Enterobacter* spp. 中发现了新的假定II类微蛋白. 基因组. 基因组. 这些都是.
- 这些新型的微蛋白在以前是基于序列的搜索方法错过的.
结论:
- 蛋白质LLM嵌入提供了一种强大而敏感的方法来发现II类微蛋白.
- 这种方法克服了基于序列的方法的局限性,允许识别新型抗微生物.
- 基于LLM的发现有望扩大潜在的新型抗生素库以打击耐药性.


