库拉-用于分析WES和WGS数据的自动化工作流
Dhanaprakash Jambulingam1, Venkat Subramaniam Rathinakannan1, Samuel Heron1
1Institute of Biomedicine, Cancer Research Unit and FICAN West Cancer Centre, University of Turku and Turku University Hospital, Turku, Finland.
PloS one
|January 18, 2024
概括
库拉是一个自动化工作流程,用于分析整个外体和整个基因组测序数据. 该工具增强了基因组研究的变异调用准确性和可重复性.
科学领域:
- 基因组科学 基因组科学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 高通量测序已经产生了大量的基因组数据,创造了对高效的分析工具的需求.
- 分析全外体测序 (WES) 和全基因组测序 (WGS) 数据在工具选择和资源优化方面提出了挑战.
- 复制性和标准化对于基因组研究中可靠的变异调用至关重要.
研究的目的:
- 介绍Kuura,一个用于全面分析WES和WGS数据的自动化工作流.
- 通过提供优化和可重复的解决方案来解决分析大规模基因组数据集的挑战.
- 通过集成多个呼叫者来提高变种呼叫的准确性和效率.
主要方法:
- 开发了一个使用Nextflow管道脚本语言和Docker进行部署的自动化工作流.
- 工作流包括四个阶段:质量控制,映射和重新校准,变量调用和重新校准以及变量注释.
- 集成的多种变体调用器 (GATK Haplotypecaller,DeepVariant,VarScan2,Freebayes,Strelka2) 用于共识变体调用.
主要成果:
- 库拉通过结合来自多个变体呼叫者的输出来生成高可信度变体的共识列表.
- 工作流通过单个参数文件和通过Docker进行标准化部署来确保可重复性.
- 灵活的设计允许通过集成额外的工具或修改参数来轻松扩展和定制.
结论:
- 库拉为WES和WGS数据分析中的变量调用提供了一个标准化,可复制和高效的工具.
- 自动化工作流便于分析大型基因组数据集,支持各种研究项目.
- 库拉的开源可用性 (https://github.com/dhanaprakashj/kuura_pipeline) 促进了其在研究界的采用和进一步发展.
更多相关视频
08:27Large-Scale Multi-Omics Genome-Wide Association Studies Mo-GWAS: Guidelines for Sample Preparation and Normalization
Published on: July 27, 2021
3.7K
09:34Targeted Next-generation Sequencing and Bioinformatics Pipeline to Evaluate Genetic Determinants of Constitutional Disease
Published on: April 4, 2018
33.8K
