纳米AbLLaMA:构建纳米体库与蛋白质大语言模型的构建
Xin Wang1, Haotian Chen1, Bo Chen2
1College of Big Data and Internet, Shenzhen Technology University, Shenzhen, China.
Frontiers in chemistry
|March 12, 2025
概括
这项研究介绍了NanoAbLLaMA,一种蛋白质大语言模型 (LLM) 用于高效的合成纳米体库构建. 它产生生殖系特定的纳米体序列,大大减少了劳动和时间.
科学领域:
- 生物技术是生物技术.
- 计算生物学 计算生物学
- 免疫学 免疫学 免疫学
背景情况:
- 传统的合成纳米体图书馆建设是资源密集的.
- 蛋白质大语言模型 (LLM) 为简化抗体工程提供了潜力.
研究的目的:
- 开发一种有效的方法来构建合成纳米体库.
- 为了利用LLM进行生殖系特异的纳米体序列生成.
主要方法:
- 开发了NanoAbLLaMA,一种基于LLaMA2的蛋白质LLM,经过低级适应 (LoRA) 的微调.
- 在120,000个精选的纳米体序列上训练了模型,这些序列根据特定的生殖系 (IGHV3-301, IGHV3S5301) 进行了条件化.
- 使用结构分析 (ImmuneBuilder,Foldseek) 验证了序列,并将性能与IgLM进行了比较.
主要成果:
- 纳米AbLLaMA实现了高的生殖线生成精度 (100%的IGHV3-301,95.5%的IGHV3S5301).
- 生成的纳米体显示出优越的预测局部距离差异测试 (pLDDT) 得分和与IgLM相比的TM-得分.
- 序列展示了降低高风险的翻译后修改站点和多样化的CDR区域,使高度人性化的图书馆成为可能.
结论:
- NanoAbLLaMA代表了纳米体图书馆建设的范式转变,减少了时间和资源需求.
- 该模型有助于创建具有高度人性化和低风险的合成库.
- 代码和数据的公开可用性旨在促进在抗体工程中更广泛的采用.


