通过批量基因表达数据评估单细胞RNASeq数据的转录组异质性
Khong-Loon Tiong1, Dmytro Luzhbin1, Chen-Hsiang Yeang2
1Institute of Statistical Science, Academia Sinica, Taipei, Taiwan.
BMC bioinformatics
|June 12, 2024
概括
本研究引入了倒向解卷,这是一个新的框架,集成了批量和单细胞RNA测序数据,以增强转录组异质性分析. 它有效地选择解卷算法,并模拟复杂组织中的细胞类型组成.
科学领域:
- 基因组学就是基因组学.
- 计算生物学 计算生物学
- 生物信息学是一种生物信息学.
背景情况:
- 单细胞RNA测序 (sc-RNASeq) 提供了高分辨率,但受到噪音和缺失数据的影响.
- 大量RNA测序提供了强大的,完整的数据,但缺乏细胞组成细节.
- 整合这些数据集可以克服对综合性转录组分析的个体限制.
研究的目的:
- 为整合批量和sc-RNASeq数据开发一种新的框架,称为倒向解卷.
- 为了利用这两种数据类型的优势,更准确地推断转录组异质性.
- 建立一种可靠的方法,用于在解卷算法中进行模型选择,并对细胞类型组成进行假设测试.
主要方法:
- 开发了一个概率图形模型框架,集成批量和sc-RNASeq数据.
- 采用多个解卷算法来分类批量数据并构建细胞级表达模型.
- 使用日志概率得分进行模型比较,并开发了处理sc-RNASeq.中缺少数据的标准.
- 在多个in-silico和现实世界生物数据集中验证了倒向解卷方法.
主要成果:
- 倒向解卷有效地选择解卷算法,显示日志概率得分和模拟和真实数据中的准确性之间的强烈相关性.
- 与对照人群相比,对自闭症谱系障碍大脑的分析显示,与对照人群相比,天体细胞的数量更高,NRGN表达神经元的数量更低.
- 在瘤数据集 (乳腺癌,低度质瘤) 中,单个细胞类型的亚型主导模式优于假定混合细胞群的模型.
结论:
- 倒向解卷是解卷算法可靠的模型选择工具.
- 该框架有助于辨别关于异质生物标本中细胞类型组成的假设.
- 这种综合方法增强了对复杂组织中转录组异质性的理解.


