使用GPU加速基因组和现象广泛关联研究 - 使用百万退伍军人计划数据的案例研究.
Alex Rodriguez1, Youngdae Kim2, Tarak Nath Nandi1
1Data Science and Learning, Argonne National Laboratory, Lemont, IL, 60439, USA.
bioRxiv : the preprint server for biology
|June 3, 2024
概括
优化了使用基于GPU的分布式计算进行大规模基因组分析的通用混合模型 (SAIGE) 算法的可扩展和准确实现. 这种方法使全基因组关联研究 (GWAS) 加速了20倍,使大规模生物库数据集的有效分析成为可能.
科学领域:
- 基因组学就是基因组学.
- 计算生物学 计算生物学
- 生物信息学是一种生物信息学.
背景情况:
- 生物库加速了基因组发现,但对大规模数据分析提出了计算挑战.
- 现有的统计框架在大量基因组数据集所需的广泛矩阵运算中扎.
研究的目的:
- 为 SAIGE 算法引入计算优化.
- 使用基于GPU的分布式计算实现高效的大规模全基因组关联研究 (GWAS).
主要方法:
- 为SAIGE算法实现基于GPU的分布式计算优化.
- 应用了优化的SAIGE来对来自退伍军人事务百万退伍军人计划 (MVP) 数据集的2,068个表型进行GWAS (635,969名参与者).
- 利用树领导力计算设施 (OLCF) 峰会高性能计算机 (HPC) 来扩展分析.
主要成果:
- 与 SAIGE 基线模型相比,在 GWAS 分析中实现了 20 倍的加速.
- 成功地将分析扩展到Summit HPC上的6000多个节点.
- 使用Docker容器对UK Biobank和All of Us数据集的优化进行了显著的时间和成本优化.
结论:
- 计算优化,特别是基于GPU的分布式计算,显著提高了SAIGE算法的可扩展性和效率,用于大规模的基因组分析.
- 优化的SAIGE方法为生物库规模的GWAS提供了实质性的计算优势,促进了更深入的基因组发现.
- 提供的Docker容器确保了不同云基础设施和数据集的广泛适用性和成本效益.


