PMFFRC:一个大规模的基因组短读压缩优化器通过内存建模和冗余集群
Hui Sun1, Yingfeng Zheng1, Haonan Xie2
1Nankai-Baidu Joint Laboratory, College of Computer Science, Nankai University, Tianjin, China.
BMC bioinformatics
|November 30, 2023
概括
这项研究介绍了PMFFRC,这是一个新的工具,通过利用大内存系统和冗余读取集群来优化基因组测序短读压缩. 它显著提高了压缩比,为基因组数据节省了大量的存储空间.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组数据压缩
背景情况:
- 基因组测序产生了大量的数据,需要高效的压缩来进行存储和共享.
- 现有的短读压缩机通常不充分利用大内存系统和文件间冗余性,限制压缩比.
- 高通量测序速度加剧了存储和数据共享的挑战.
研究的目的:
- 为了开发一个大规模的基因组测序短读数据压缩优化器.
- 通过利用大内存系统和冗余读取集群来提高压缩比.
- 为了减少基因组数据的存储空间支出.
主要方法:
- 开发了PMFFRC,这是一个利用新性内存建模的压缩优化器.
- 实施冗余的阅读集群技术,以增强数据压缩.
- 在大型数据集上使用最先进的压缩机 (HARC,SPRING,Mstcom,FastqCLS) 连接PMFFRC.
主要成果:
- PMFFRC实现了显著的压缩比增长:77.89% (HARC),77.56% (SPRING),73.51% (Mstcom) 和29.36% (FastqCLS) 的压缩比增长.
- 这导致存储空间节省了39.41% (HARC),41.62% (SPRING),40.99% (Mstcom) 和20.19% (FastqCLS).
- 证明了对982GB的测序数据的存储大小的大幅减少.
结论:
- PMFFRC有效地利用大内存系统来节省序列阅读数据存储空间.
- 该工具减少了存储成本和社区数据共享的开销.
- PMFFRC提供了一种用于改进序列阅读压缩的新解决方案,并作为Linux工具包提供.


