使用基于商标蛋白质家族构建的随机森林模型对巨型病毒基因组进行自动分类
Anh D Ha1, Frank O Aylward2,3
1Department of Biological Sciences, Virginia Tech, Blacksburg, VA, 24061, USA. anhdha@vt.edu.
Npj viruses
|April 28, 2025
概括
我们开发了TIGTOG,这是一款机器学习工具,使用蛋白质家族概况准确地分类巨型病毒 (Nucleocytoviricota). 这种方法为巨型病毒分类学提供了快速可靠的方法.
科学领域:
- 病毒学 病毒学
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
背景情况:
- 巨型病毒 (核细胞病毒科) 在全球分布,具有生态意义.
- 它们的遗传学多样性和复杂的基因组挑战了传统的分类学分类,特别是不完整的元基因组组装基因组 (MAGs).
研究的目的:
- 开发一种基于机器学习的方法,用于对巨型病毒进行准确的分类.
- 为了应对对不完整巨型病毒MAG分类的挑战.
主要方法:
- 开发了TIGTOG (使用商标正统组的巨型病毒的分类学信息),一种随机森林算法.
- 训练模型使用来自1531个核细胞病毒基因组和巨型病毒正基因组 (GVOG) 的蛋白质家族含量概况.
- 在823个巨型病毒基因组的独立集合上验证了模型,其完整性和分类学各不相同.
主要成果:
- 实现了高的交叉验证准确性:99.6%在订单层面和97.3%在家庭层面.
- 证明了强大的验证准确性:98.6%在订单层面和95.9%在家庭层面.
- 分类依赖于全面的基因组签名,而不是单个标记基因.
结论:
- 蛋白家族概况为分类大型DNA病毒在多个分类学层面提供了准确的方法.
- TIGTOG为巨型病毒分类提供了快速而准确的解决方案.
- 这种方法可以适应其他病毒群.


