对于Galaxy中的敏感临床研究数据的FAIR数据检索
Jasper Ouwerkerk1, Helena Rasche1, John D Spalding2
1Clinical Bioinformatics Group, Department of Pathology, Erasmus Medical Center, 3015 CN, Rotterdam, the Netherlands.
GigaScience
|January 27, 2024
概括
本研究介绍了一个基于银河系的平台,用于FAIR (可查找,可访问,可互操作,可重复使用) 基因组数据分析,增强欧洲基因组-基因组档案 (EGA) 的可复制性和数据可访问性.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 数据科学数据科学数据科学
背景情况:
- 临床研究产生大型,复杂的数据集,需要可访问和可重复的数据分析.
- 现有的平台在与现代基因组数据的规模和复杂性作斗争.
- 可查找,可访问,可互操作和可重复使用 (FAIR) 数据原则对于科学进步至关重要.
研究的目的:
- 在银河系内开发一个公平的数据分析平台,用于基因组研究.
- 将欧洲基因组-基因组档案 (EGA) 与Galaxy集成,以实现无数据检索.
- 为可重复数据分析创建一个通用的"omics"平台.
主要方法:
- 实现了一个端到端的Galaxy工作流,使用PyEGA3访问EGA基因组数据.
- 整合了gene.iobio工具,以提高精确基因组学中的诊断能力.
- 开发了一种使用GEMINI和gene.iobio进行变种识别的银河三星分析工作流.
主要成果:
- 成功演示了PyEGA3集成,用于在Galaxy.com内从EGA下载多个数据集.
- 通过复制来自合成数据集 (synB1MG) 的发现并重新发现入变体来验证工作流.
- 增强了现有的Galaxy工具,并创建了一个新的三人分析工作流.
结论:
- 通过PyEGA3确定了在Galaxy中重复使用EGA数据的可行性,用于可重复的研究.
- 通过三人分析工作流程展示了Galaxy中FAIR基因组学分析的价值.
- 为研究人员提供了全面的教程和工作流程,以采用FAIR数据实践.


