在统计学上最大分辨率的单细胞RNA-seq数据中识别细胞状态.
Pascal Grobecker1, Thomas Sakoparnig1, Erik van Nimwegen1
1Biozentrum, University of Basel and Swiss Institute of Bioinformatics, Basel, Switzerland.
PLoS computational biology
|July 12, 2024
概括
细胞状态通过识别不同的基因表达状态,准确地划分单细胞RNA测序 (scRNA-seq) 数据. 这种方法基于原始的独特分子标识符 (UMI) 计数,可稳定地发现没有可调节参数的生物基底结构.
科学领域:
- 基因组学和生物信息学
- 计算生物学 计算生物学
- 分子生物学分子生物学
背景情况:
- 单细胞RNA测序 (scRNA-seq) 揭示了基因表达变异,但由于数据稀疏性和噪声而面临挑战.
- 现有的scRNA-seq数据集群方法往往缺乏明确的目标,涉及复杂的预处理,并产生难以从生物物理上解释的结果.
- 将细胞精确地划分成不同的基因表达状态对于理解细胞异质性至关重要.
研究的目的:
- 开发一种数学上严格的方法,将scRNA-seq数据分成统计上无法区分的基因表达状态.
- 创建一个直接运行在原始独特分子标识符 (UMI) 数据上的工具,自动确定最佳分区和集群号.
- 确保已识别的细胞状态反映生物变异,独立于技术实验因素.
主要方法:
- 从第一原则中推导出一个统计学上精确的解决方案,考虑到scRNA-seq数据的已知测量噪声结构.
- 在一个名为Cellstates的软件工具中实现了该解决方案,该软件需要零可调节参数并处理原始UMI计数数据.
- 开发了用于等级聚类,差异基因表达分析和识别细胞状态的可视化补充软件.
主要成果:
- 细胞状态准确地恢复合成数据集上的最佳分区.
- 在真实的scRNA-seq数据上,Cellstates可在传统注释的细胞类型中稳定地识别微妙的亚结构.
- 鉴定出基因表达状态的多样性系统地取决于起源组织,而不是技术实验特征.
结论:
- 细胞状态提供了一个原则和无参数的方法来从scRNA-seq数据中解构细胞异质性.
- 该方法有效地减少了数据的复杂性,同时保持了有意义的生物结构.
- 细胞状态通过揭示生物学上相关的细胞状态及其等级关系,促进了更深入的生物学见解.


