快速集群和scATAC数据的单元类型注释使用预先训练的嵌入式
Nathan J LeRoy1,2, Jason P Smith1,3,4, Guangtao Zheng5
1Center for Public Health Genomics, School of Medicine, University of Virginia, Charlottesville, VA 22908, USA.
NAR genomics and bioinformatics
|July 8, 2024
概括
本研究介绍了scEmbed,这是一个新的机器学习框架,用于使用测序 (scATAC-seq) 数据对转化酶可访问的染色质进行单细胞测定. scEmbed利用预先训练的模型进行高效的单元类型注释和改进的集群.
科学领域:
- 基因组学就是基因组学.
- 计算生物学 计算生物学
- 机器学习 机器学习
背景情况:
- 使用测序 (scATAC-seq) 数据对转化酶可访问的染色质的单细胞检测越来越多.
- 在scATAC-seq数据中的高维度和稀疏性带来了重大的计算挑战.
- 目前的方法在单个步骤中生成细胞嵌入,从而限制了灵活性.
研究的目的:
- 开发一个灵活和计算效率高的框架来分析scATAC-seq数据.
- 通过使用预训练的嵌入模型引入转移学习方法.
- 为了实现快速准确的单元类型注释,而无需多模式数据.
主要方法:
- 实施scEmbed,一个无监督的机器学习框架.
- 学习基因组调节区域的低维嵌入.
- 使用在参考scATAC-seq数据上预训练的模型.
主要成果:
- scEmbed表现出强大的集群性能.
- 该框架有效地学习了区域共发生的可转移模式.
- 预先训练好的模型可以快速准确地对细胞类型进行注释.
结论:
- 预训练的嵌入模型为scATAC-seq分析提供了一种灵活且具有计算优势的方法.
- scEmbed提供了一个强大的工具,用于发现监管区域共发生的模式.
- 该框架允许高效的单元类型注释,减少对其他数据模式的依赖.


