Scellpam:一个R包/C++库,可以在scRNAseq数据集上的 medoids 周围执行并行分区
Juan Domingo1, Teresa Leon2, Esther Dura3
1Department of Informatics, ETSE, University of Valencia, Avda. de la Universidad, s/n, 46100, Burjassot, Valencia, Spain. Juan.Domingo@uv.es.
BMC bioinformatics
|September 14, 2023
概括
新软件提供了一个更快,更节省内存的PAM (Partitioning Around Medoids) 集群方法. 这种并行工具显著加快了距离矩阵计算和PAM实现的速度,特别是对于像单细胞实验这样的大数据集.
科学领域:
- 计算生物学是一种计算生物学.
- 数据科学是数据科学.
- 生物信息学是一种生物信息学.
背景情况:
- 围绕Medoids分区 (PAM) 是一种广泛使用的集群方法,只需要距离/不相似性测量.
- PAM的集群中心是实际的数据点,作为可靠的代表.
- 距离矩阵计算的大量内存和计算成本限制了PAM的可扩展性.
研究的目的:
- 解决PAM集群算法的内存和计算挑战.
- 开发用于计算距离矩阵和实施PAM的高效软件.
- 为大型生物数据集,特别是单细胞实验,实现可扩展的聚类.
主要方法:
- 开发了并行软件,用于计算各种距离/不相似度矩阵 (例如,欧几里德,皮尔森,等号).
- 实现了PAM (FASTPAM1) 的并行,内存高效版本,支持各种数据类型.
- 使用多核处理来加速计算.
主要成果:
- 该软件显著减少了距离矩阵计算和PAM集群的执行时间.
- 通过在FASTPAM1.1中高效的数据类型处理,减少了内存使用量.
- 成功聚合了多达289,000个细胞和29,000个基因的单细胞实验数据.
结论:
- 在距离矩阵计算和PAM实现方面,新软件在速度上大大超过现有的R包.
- 该包对于单细胞RNA-seq研究和其他大规模数据聚类任务是非常有益的.
- 软件以R包和C++库的形式提供,以实现广泛的可访问性.


