对病毒发现的基准信息学方法:在结合形识别方法时需要谨慎
Bridget Hegarty1, James Riddell V2, Eric Bastien3
1Department of Civil and Environmental Engineering, Case Western Reserve University, Cleveland, Ohio, USA.
mSystems
|February 20, 2024
概括
结合病毒识别工具需要谨慎. 基准测试表明,特定的组合,特别是包括VirSorter2在内的组合,可以优化病毒从元基因组中恢复,而过度的组合不能提高准确性.
科学领域:
- 病毒学 病毒学
- 生物信息学是一种生物信息学.
- 转基因组学是指转基因组学.
- 微生物生态学 微生物生态学
背景情况:
- 从元基因组数据准确识别病毒对于理解生态影响至关重要.
- 研究人员经常结合多种生物信息学工具来最大限度地恢复病毒,但这种方法的有效性尚未得到验证.
- 现有的病毒识别工具在优化针对特定研究需求的病毒恢复方面存在挑战.
研究的目的:
- 为了对六种广泛使用的病毒识别信息学工具 (规则集) 的组合进行基准测试.
- 评估工具组合对模拟和环境元基因组中的病毒恢复和准确性的影响.
- 为*in silico*病毒鉴定提供最佳策略的指导.
主要方法:
- 六种病毒识别工具 (VirSorter,VirSorter2,VIBRANT,DeepVirFinder,CheckV,Kaiju) 和它们的组合 (规则集) 的基准测试.
- 测试规则对具有多种序列类型和水生元基因组的模拟元基因组进行测试.
- 基于准确度指标的工具性能评估,如马修斯相关系数 (MCC).
主要成果:
- 六个规则集实现了同等的准确性 (MCC = 0.77),每个规则集包括VirSorter2,五个规则使用"调整删除"规则.
- 结合多种工具并不总是导致最佳性能;特定的2-4种工具组合是最有效的.
- 准确度高原 (MCC 0.77) 可能部分是由于参考序列数据库中的不准确性.
- 性能最好的规则集在富含病毒的水生元基因组中 (44%-46%) 发现的病毒序列明显多于细胞元基因组 (7%-19%).
结论:
- 结合病毒识别工具应谨慎使用;并非所有组合都能提高性能.
- 建议将VirSorter2规则组与经验衍生的"调整删除"规则相结合,以进行可靠的病毒识别.
- 未来对病毒识别算法的改进应该与对参考序列数据库的仔细策划相结合.


