用共同工作流语言 (CWL) 调用RNA-Seq,ChIP-Seq和生殖系变异分析的软件管道
Konstantinos A Kyritsis1, Nikolaos Pechlivanis1,2, Fotis Psomopoulos1
1Institute of Applied Biosciences (INAB), Centre for Research and Technology Hellas (CERTH), Thessaloniki, Greece.
Frontiers in bioinformatics
|November 29, 2023
概括
使用通用工作流语言 (CWL) 的自动化生物信息管道确保高通量测序 (HTS) 数据的可重复分析. 这些CWL工作流程准确地复制结果并检测遗传变异,促进在慢性淋巴细胞白血病 (CLL) 等领域的研究.
科学领域:
- 生物信息学和计算生物学
- 基因组学和分子生物学
- 数据科学和机器学习
背景情况:
- 数据分析中的可重复性至关重要,特别是对于大规模的高通量测序 (HTS) 数据集.
- 数据分析管道的自动化解决了基因组学研究中对一致和可靠结果的需求.
- 生物信息学的挑战包括软件不兼容性和复杂的配置,阻碍可重现性.
研究的目的:
- 开发和评估用于HTS数据分析的自动化通用工作流语言 (CWL) 管道.
- 评估CWL工作流程在复制已发表的结果和检测遗传变异方面的表现.
- 为标准生物信息学分析提供灵活,可重复使用和开源的资源.
主要方法:
- 使用通用工作流语言 (CWL) 实现自动化工作流.
- 对RNA-Seq,ChIP-Seq和生殖系变异调用实验的分析.
- 通过繁殖验证慢性淋巴细胞白血病 (CLL) 研究结果和分析瓶中的基因组 (GIAB) 联盟数据.
主要成果:
- 在CWL实施的工作流程中,CWL在复制之前的发现方面表现出高准确性.
- 在慢性淋巴细胞白血病 (CLL) 数据集中成功识别了重要的生物标志物.
- 在全基因组测序数据中精确检测生殖单核酸多态 (SNP) 和小插入/删除 (INDEL) 变异.
结论:
- 在生物信息学分析中,CWL管道在可重复性和可重复使用性方面具有显著的优势.
- 与CWL相结合的容器化克服了软件兼容性和配置挑战.
- 开发的CWL工作流程灵活,适应性强,并作为短读数据分析的开放资源,促进自动化和跨平台兼容性.


