利用大型语言模型来预测蛋白质相位过渡:一种物理,多尺度和可解释的方法
Mor Frank1,2, Pengyu Ni1,2, Matthew Jensen1,2
1Program in Computational Biology and Bioinformatics, Yale University, New Haven, CT 06520.
概括
大型语言模型 (LLM) 现在可以预测蛋白质相变 (PPT),区分液滴和固体聚合物. 这种统一的方法有助于理解疾病机制和蛋白质设计,优于旧的方法.
科学领域:
- 生物化学 生化学
- 计算生物学 计算生物学
- 神经科学是一个神经科学.
背景情况:
- 蛋白质相转换 (PPT),包括液-液相分离和粉样蛋白聚合,与阿尔茨海默氏症等与年龄有关的疾病有关.
- 现有的计算工具单独预测滴滴或聚合物形成,缺乏统一的框架.
- 大型语言模型 (LLM) 在蛋白质结构预测方面表现有前途,但尚未应用于PPT.
研究的目的:
- 开发和验证使用LLM来预测液体和固体蛋白质相位过渡的统一计算框架.
- 评估蛋白质序列变异对PPT对蛋白质设计中的应用的影响.
- 为了比较基于LLM的框架与经典计算基准的性能.
主要方法:
- 微调一个大型语言模型 (LLM) 用于预测蛋白质相转换 (PPT).
- 使用具有生物物理特征的随机森林模型来解释LLM预测.
- 分析与阿尔茨海默病相关的蛋白质,以调查聚合倾向与基因表达之间的关系.
主要成果:
- 微调的LLM成功地预测了统一框架内的液体和固体蛋白质相位过渡.
- 基于LLM的方法在与已建立的计算基准相比,表现优越.
- 使用随机森林模型进行解释,可以了解PPT的生物物理驱动因素.
- 在阿尔茨海默病中观察到,聚合易发生的蛋白质的基因表达减少.
结论:
- LLM提供了一种强大,统一的方法来预测各种蛋白质相变 (PPT).
- 这种方法促进了对PPT的序列变异影响的研究,有助于蛋白质设计和疾病研究.
- 研究结果表明,在阿尔茨海默病中,对蛋白质聚合存在潜在的自然防御机制.


