iSeqSearch:对iBlast/iMMSeqs2/iDiamond进行增量蛋白质搜索
Hyunwoo Yoo1, Mohammadsaleh Refahi1, Robi Polikar2
1Department of Electrical and Computer Engineering, Drexel University, Philadelphia, PA, United States of America.
PeerJ
|May 2, 2025
概括
像iSeqsSearch这样的增量搜索方法通过重复使用数据有效地更新基因组和蛋白质组数据库搜索. 这种方法将iBlast扩展到支持MMseqs2 (iMMseqs2) 和Diamond (iDiamond),减少资源浪费,同时保持高精度.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
- 蛋白质组学是指蛋白质组学.
背景情况:
- 测序技术的进步迅速增加了DNA和蛋白质数据,导致不断增长的基因组和蛋白质组数据库.
- 经常更新数据库是必要的,但重新搜索整个数据集是资源密集的.
- 增量数据库搜索通过重复使用先前处理的信息来解决这一挑战.
研究的目的:
- 将iBlast增量搜索方法推广为支持MMseqs2和Diamond等高级序列搜索工具.
- 开发一个更强大,更广泛的增量搜索框架,名为iSeqsSearch.
- 为科学界提高增量搜索的可用性.
主要方法:
- 提出了iSeqsSearch,这是iBlast框架的扩展.
- 通过iMMseqs2和Diamond通过iDiamond为MMseqs2提供综合支持.
- 修改了现有的iBlast封装,以提高强度和社区可用性.
主要成果:
- iMMseqs2和iDiamond表现出与独立的MMseqs2和Diamond工具几乎相同的性能.
- 在增量和常规搜索方法之间观察到高一致性 (皮尔森相关性>0.9).
- 该iSeqsSearch框架有时比传统的MMseqs2和钻石搜索产生了更多的搜索结果.
结论:
- 使用iMMseqs2和iDiamond的增量方法是高效的,重复使用数据,同时保持准确性和结果一致性.
- 这种方法有效地减少了搜索大型,不断增长的基因组和蛋白质组数据库的资源浪费.
- 样本代码和数据是公开可用的,用于更广泛的采用和研究.


