使用蛋白质学信息的大型语言模型的变异分类增加了罕见变异关联研究的力量,并增强了目标发现
Christopher E Gillies1, Joelle Mbatchou1, Lukas Habegger1
1Regeneron Genetics Center, Tarrytown, New York, USA.
Genetic epidemiology
|November 3, 2025
概括
使用蛋白质组学数据改进了用于预测有害遗传变异的大型语言模型 (LLM). 这种精细的方法增强了在人类遗传研究中发现基因特征关联的发现.
科学领域:
- 遗传学 遗传学 是一个
- 生物信息学是一种生物信息学.
- 蛋白质组学是指蛋白质组学.
背景情况:
- 罕见变异关联分析对于理解人类生物学至关重要.
- 预测遗传变异的影响对于这种分析至关重要.
- 深度学习和大型语言模型 (LLM) 在变量影响预测方面表现有前途.
研究的目的:
- 使用蛋白质组学数据评估和完善有害遗传变异的LLM预测因素.
- 评估蛋白质学引导的LLM在识别基因特征关联方面的表现.
主要方法:
- 利用来自2898种蛋白质的46665个个体的蛋白质组学数据.
- 开发和完善基于LLM的变体预测器.
- 评估了241个阳性对照基因特征对和10个英国生物库特征的模型性能.
主要成果:
- 蛋白质学引导的LLM在识别有害的误解变体方面超过了传统和机器学习方法.
- 该模型总结了已知的36.5%的基因特征关联,超过了其他选择.
- 177个新的基因特征关联被确定使用英国生物库数据模型.
结论:
- 蛋白质组学数据可以有效地改进LLM变体分类.
- 这种方法显著提高了人类遗传研究的发现潜力.
更多相关视频
08:04Identification and Classification of Position-specific GABAA Receptor Subunit Missense Variants for Their Role In Hippocampal Pyramidal Neurons
Published on: June 6, 2025
1.3K
06:41In Vivo Functional Study of Disease-associated Rare Human Variants Using Drosophila
Published on: August 20, 2019
14.2K
