SCEMENT:大规模单细胞RNA测序数据的可扩展和内存高效集成
Sriram P Chockalingam1, Maneesha Aluru2, Srinivas Aluru3
1Institute for Data Engineering and Science, Georgia Institute of Technology, Atlanta, GA-30332, United States.
Bioinformatics (Oxford, England)
|February 22, 2025
概括
SCEMENT是一种新的可扩展和存储效率高的方法,用于整合大型单细胞RNA测序数据集. 它显著提高了计算效率和准确性,使细胞类型和基因网络的更好发现成为可能.
科学领域:
- 计算生物学是一种计算生物学.
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
背景情况:
- 大规模单细胞RNA测序 (scRNA-seq) 数据集成对于理解复杂的生物系统至关重要.
- 现有的算法在数百万个单元和大型数据集的可扩展性方面扎,往往为了效率而牺牲准确性.
- 目前的方法使用诸如分样或参考数据集之类的快捷方式,阻碍了定量基因表达分析.
研究的目的:
- 开发一个可扩展和内存高效的算法,用于准确整合大规模的scRNA-seq数据.
- 在计算成本和准确性方面克服现有方法的局限性.
- 为了实现强大的下游分析,需要精确的基因表达信息.
主要方法:
- 介绍了SCEMENT (SCalablE和Memory-Efficient iNTegration),一个平行算法扩展了线性回归模型.
- 使用无监督的稀疏矩阵设置,以实现高效的数据集成.
- 在C++中实现了该方法,以便在Linux系统上实现高性能.
主要成果:
- 与ComBat,FastIntegration和Scanorama相比,SCEMENT在运行时间 (最快214倍) 和内存使用 (最少17.5倍) 方面表现出卓越的性能.
- 在不到25分钟的时间里,成功地将数以百万计的细胞从几十到几百个scRNA-seq数据集集集成在一起.
- 促进了罕见细胞类型的发现,并改善了基因调控网络的重建,具有完整的定量基因表达.
结论:
- SCEMENT为大规模scRNA-seq数据集成提供了准确,可扩展和内存高效的解决方案.
- 该方法保留了定量基因表达信息,这对于深入的生物分析至关重要.
- SCEMENT能够从复杂的单细胞数据集中更稳健地发现生物见解.


