通过大型语言模型预测TET和DNMT3淘汰突变体中的差异甲基化细胞因子
Saleh Sereshki1, Stefano Lonardi1
1Department of Computer Science and Engineering, University of California, Riverside, 900 University Ave, Riverside, 92521, CA, United States.
bioRxiv : the preprint server for biology
|September 16, 2024
概括
这项研究训练了一种大型语言模型,以识别DNA中的差异甲基化细胞因子 (DMC). 该模型预测了跨物种的DMC和酶淘汰,促进了对DNA甲基化动态的理解.
科学领域:
- 表观遗传学 在表观遗传学中,表观遗传学是指表观遗传学.
- 基因组学就是基因组学.
- 计算生物学 计算生物学
背景情况:
- DNA细胞因子甲基化是细胞过程的关键表观遗传调节剂.
- 哺乳动物基因组保持甲基化模式,调节区域发生动态变化.
- DNA甲基化动态涉及DNMT3和TET等酶.
研究的目的:
- 训练一个大型语言模型,以识别人类和小鼠基因组中的差异甲基化细胞蛋白 (DMC).
- 评估训练模型的跨物种和跨突变者预测能力.
- 为了确定与TET和DNMT3淘汰突变体中DMCs相关的序列动机.
主要方法:
- 利用大型语言模型进行基于序列的DMC识别.
- 经过培训和测试的分类器对来自TET和DNMT3淘汰突变的人类和小鼠胚胎干细胞数据进行了培训和测试.
- 分析了与特定淘汰赛环境中的DMC预测相关的序列动机.
主要成果:
- 证明了大型语言模型的成功训练,以从周围的DNA序列中识别DMC.
- 展示了该模型在人类和小鼠基因组中预测DMC的能力.
- 证实了DNMT3和TET淘汰数据集之间的交叉预测准确性.
- 在突变基因组中确定了与DMC相关的统计学意义上的动机.
结论:
- 大型语言模型可以有效地根据DNA序列上下文识别DMC.
- 开发的模型有助于跨物种和跨突变者对DNA甲基化变化的预测.
- 这项研究为DNA甲基化动态和干细胞调节动机提供了新的见解.


