运行长度压缩的元基因组读取分类与SMEM查找和标记
Lore Depuydt1, Omar Y Ahmed2, Jan Fostier1
1Department of Information Technology - IDLab, Ghent University - imec.
bioRxiv : the preprint server for biology
|March 10, 2025
概括
我们开发了一种新的元基因组分类方法,使用压缩索引来有效分析测序数据. 与现有工具相比,这种方法提高了准确性和运行时间,为各种数据集提供了多功能解决方案.
科学领域:
- 计算生物学 计算生物学
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
背景情况:
- 由于大量,多样化和复杂的测序数据,元基因组读取分类至关重要,但具有挑战性.
- 现有的方法在各种数据集的效率和准确性方面扎.
研究的目的:
- 引入一种新,高效,准确的元基因组读取分类方法.
- 为了利用运行长度压缩和超最大精确匹配 (SMEMs) 来改进分类.
- 提供一个多功能工具,平衡准确性,运行时间和内存使用.
主要方法:
- 使用基于BWT移动结构的运行长度压缩索引.
- 识别所有最小长度的超最大精确匹配 (SMEM).
- 采用采样标签数组用于类识别和最终分类的共识算法.
主要成果:
- 该方法在压缩空间中实现了高效的多类元基因组分类.
- 它在准确性和运行时间方面始终优于SPUMONI 2.
- 与Cliffy相比,在更简单的数据集上表现出更高的内存效率,在复杂的数据集上表现出相似的性能.
结论:
- 这种新的方法为元基因组分类提供了一个多功能和高效的解决方案.
- 它有效地平衡了对不同测序数据集的准确性,运行时间和内存使用.
- 一个开源的C++11实现是公开可用的,以便更广泛地采用.


