使用VADR对人类呼吸道病毒序列进行自动注释和验证.
Jeffrey Furlong1, Stephanie Goya1, Eric P Nawrocki2
1Department of Laboratory Medicine and Pathology, University of Washington Medical Center, Seattle, WA, 98109, USA.
bioRxiv : the preprint server for biology
|August 20, 2025
概括
美国国家银行 (NCBI)
科学领域:
- 病毒学 病毒学
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
背景情况:
- 准确的病毒基因组注释对于研究和数据共享至关重要.
- NCBI的病毒注释定义R (VADR) 管道提供标准化的注释,但支持有限的病毒组.
- 扩大VADR的能力对于全面的病毒监测至关重要.
研究的目的:
- 为12种主要的人类呼吸道病毒开发和验证新的VADR模型.
- 提高病毒基因组注释的准确性和可扩展性.
- 通过加强病毒数据分析,支持公共卫生倡议.
主要方法:
- 构建基于参考序列的VADR模型,使用物种内部的基因组和遗传学多样性.
- 在超过5000个公共病毒基因组上训练模型,并在数百个新基因组上进行了测试.
- 包括基因组结构,注释,重叠的ORF和潜在的错误组装的分析.
主要成果:
- 实现了高VADR管道性能,通过了超过96%的测试病毒基因组.
- 成功识别了复杂的基因组特征,如重叠的ORF和转录滑动.
- 检测到新的生物见解,包括人类冠状病毒NS2淘汰和新的编码序列长度.
结论:
- 新的VADR模型显著提高了病毒基因组注释的准确性和范围.
- 这些模型被整合到NCBI的GenBank提交管道中,提高了数据质量.
- 公共可用的模型为研究和公共卫生提供了可扩展的注释.


