埃皮基础:通过峰值对基因对齐来实现单细胞ATAC-seq的基础模型
Juncheng Wu1, Changxin Wan2, Zhicheng Ji2
1Department of Computer Science and Engineering, UC Santa Cruz.
bioRxiv : the preprint server for biology
|February 20, 2025
概括
我们开发了EpiFoundation,这是一种用于单细胞ATAC-seq数据分析的新型基础模型. 这个模型有效地处理稀疏的表观遗传数据,以改善细胞类型注释和基因表达预测.
科学领域:
- 计算生物学 计算生物学
- 基因组学就是基因组学.
- 表观遗传学 在表观遗传学中,表观遗传学是指表观遗传学.
背景情况:
- 基础模型通过在大型数据集上进行自我监督的预培训,在下游任务中表现出色.
- 现有的基础模型主要关注单细胞RNA-seq (scRNA-seq) 数据.
- 由于数据稀疏性和高维度,针对单细胞ATAC-seq (scATAC-seq) 量身定制的基础模型存在差距.
研究的目的:
- 介绍EpiFoundation,这是一个旨在从高维和稀疏的scATAC-seq峰值数据中学习细胞表示的基础模型.
- 为了应对scATAC-seq分析中大量峰值和数据稀疏性的挑战.
- 为了实现强大的下游应用程序,如细胞类型注释,批次校正和基因表达预测.
主要方法:
- 开发了EpiFoundation,这是一个专门处理非零峰的基础模型,以增强细胞特异信息密度.
- 实施了一种交叉模式的预训练策略,使用密集的基因表达数据来监督峰值与基因相关性对齐.
- 策划的MiniAtlas,一个大型数据集,配对scRNA-seq和scATAC-seq数据用于培训和验证.
主要成果:
- EpiFoundation有效地从稀疏的scATAC-seq数据中学习细胞表征.
- 该模型在多种组织和各种下游任务中展示了最先进的性能.
- EpiFoundation成功地处理了细胞类型注释,批次校正和基因表达预测.
结论:
- 在使用基础模型分析scATAC-seq数据方面,EpiFoundation代表了重大进展.
- 创新的预培训策略克服了与scATAC-seq数据稀疏性和维度相关的关键挑战.
- 在单细胞研究中,EpiFoundation为表观遗传数据分析提供了一个强大而通用的工具.


