在单细胞转录基因数据中识别细胞子群:贝叶斯混合模型方法来计算零通货膨胀
Tom Wilson1, Duong H T Vo1, Thomas Thorne1
1Department of Computer Science, University of Surrey, Guildford, United Kingdom.
概括
这项研究引入了一种新的贝叶斯模型,用于单细胞RNA测序 (scRNA-Seq) 数据分析. 该方法准确地识别细胞亚群并量化不确定性,优于scRNA-Seq计数数据的现有方法.
科学领域:
- 计算生物学 计算生物学
- 基因组学就是基因组学.
- 统计建模 统计建模
背景情况:
- 识别细胞亚群对于分析单细胞RNA测序 (scRNA-Seq) 数据至关重要.
- 现有的机器学习方法往往缺乏对集群分配的不确定性估计.
- 由于高比例的零计数 (脱落),scRNA-Seq数据提出了挑战,使概率模型复杂化.
研究的目的:
- 为scRNA-Seq数据分析开发一种新的概率模型,该模型解决了脱学问题,并提供了不确定性估计.
- 改进细胞亚种群和基因表达模式在这些亚种群的识别.
- 为现有的 scRNA-Seq 数量数据建模方法提供更强大的替代方案.
主要方法:
- 开发Dirichlet过程混合模型,包括细胞级和转录级混合物.
- 使用零膨胀的负二项式分布来建模转录数量,计算掉队.
- 采用贝叶斯方法来建模基因表达和量化集群分配中的不确定性.
主要成果:
- 提出的模型在scRNA-Seq计数方面表现优于多项式和非零膨胀负二项式模型.
- 在小鼠皮质和海马体scRNA-Seq数据中证明了区分细胞亚群的能力.
- 成功识别了特定细胞亚群的特征基因组.
结论:
- 新的贝叶斯迪里克莱特过程混合模型有效地处理scRNA-Seq数据中的脱落.
- 这种方法提供了可靠的细胞亚种群识别与量化不确定性.
- 该方法有助于发现不同细胞类型的标记基因,从而推进单细胞数据分析.


