用深度蛋白质语言模型对疾病变异效应的全基因组预测
Nadav Brandes1, Grant Goldman2, Charlotte H Wang3
1Division of Rheumatology, Department of Medicine, University of California, San Francisco, San Francisco, CA, USA.
像ESM1b这样的蛋白质语言模型现在可以预测所有人类误解变体的影响,克服了以前方法的局限性. 这一进步为了解遗传变异和疾病提供了一个强大的新工具.
科学领域:
- 基因组学和生物信息学
- 计算生物学 计算生物学
- 分子生物学分子生物学
背景情况:
- 预测遗传编码变体的功能影响仍然是基因组学的一个重大挑战.
- 目前用于变量效应预测的深度学习模型面临局限性,包括依赖同源序列和软件约束,防止全面分析.
- 众多可能的编码变体需要可扩展和准确的预测方法.
研究的目的:
- 开发一种新的工作流程,用于预测人类基因组中所有可能的误解变异的影响.
- 评估蛋白质语言模型 (ESM1b) 对于变异效应预测的性能.
- 通过一个网页门户提供可访问的变异效应预测的全面资源.
主要方法:
- 利用ESM1b,一个大规模的蛋白质语言模型,拥有6.5亿个参数,来预测误解变异效应.
- 开发了一种计算工作流来分析人类基因组中大约4.5亿个潜在的误解变异.
- 根据已建立的变异数据库 (ClinVar/HGMD) 和深度突变扫描数据集进行验证的预测.
主要成果:
- 与现有方法相比,ESM1b在将误解变异分类为致病性或良性方面表现出卓越的表现.
- 该模型准确地预测了28个不同的深度突变扫描数据集的变异效应.
- 确定了大约200万个具有异形特异性破坏性影响的变异,突出显示了异形考虑的重要性.
- 这种方法成功地被通用化到预测复杂变体的影响,包括内框架indels和stop-gains.
结论:
- 蛋白质语言模型为预测编码变体的功能影响提供了一种有效,准确和可概括的方法.
- 开发的工作流程和网络门户网站为基因组变异解释提供了宝贵的资源.
- 这项工作推进了变异效应预测领域,使得对遗传变异在健康和疾病中的作用进行了更广泛的分析.
更多相关视频
11:35Screening for Functional Non-coding Genetic Variants Using Electrophoretic Mobility Shift Assay EMSA and DNA-affinity Precipitation Assay DAPA
Published on: August 21, 2016
07:15Determining the Likelihood of Variant Pathogenicity Using Amino Acid-level Signal-to-Noise Analysis of Genetic Variation
Published on: January 16, 2019
相关概念视频
Genome-wide Association Studies-GWAS
GWAS does not require the identification of the target gene involved in...
Conservation of Protein Domains Over Different Proteins
A limited set of protein domains often duplicate and recombine during evolution. These domains can be organized in different combinations to...
Physiological Pharmacokinetic Models: Assumption with Protein Binding
Protein Networks
These interactions can be represented through maps depicting protein-protein interaction networks, represented as nodes and edges. Nodes are circles that are representative of a protein,...
Leaky Scanning
Improving Translational Accuracy
