优化英国生物银行基于云计算的研究分析平台,以精确地绘制全基因组测序数据中的冠状动脉疾病位置
Letitia M F Sng1, Anubhav Kaphle2, Mitchell J O'Brien3
1Australian e-Health Research Centre, Commonwealth Scientific and Industrial Research Organisation (CSIRO), Westmead, New South Wales, Australia. letitia.sng@csiro.au.
Scientific reports
|March 26, 2025
概括
这项研究分析了英国生物银行全基因组测序数据中的冠状动脉疾病 (CAD),确定了关键的遗传变异. 先进的机器学习方法比CAD遗传发现的传统方法更有效.
科学领域:
- 遗传学 遗传学 是一个
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 英国生物银行 (UKB) 为大规模的遗传关联研究提供了宝贵的资源.
- 冠状动脉疾病 (CAD) 是一个重要的健康问题,具有复杂的遗传基础.
- 来自大型生物库的全基因组测序数据需要先进的分析方法.
研究的目的:
- 使用UKB全基因组测序数据集,进行CAD的第一个全面关联分析.
- 将机器学习 (ML) 方法的有效性与用于识别CAD风险位置的传统方法进行比较.
- 优化计算工作流程,在云环境中分析大规模的基因组数据.
主要方法:
- 利用PolyFun工具在9p21.3 CAD风险位置内精细绘制遗传变异.
- 应用机器学习算法 (REGENIE,VariantSpark) 和单核酸变体 (SNV) 物流回归用于关联分析.
- 在英国生物银行研究分析平台上实施计算架构优化 (RAPpoet),以提高成本和速度.
主要成果:
- 确定rs10757274作为9p21.3 CAD风险位置中最可能的因果性SNV.
- 证明了ML方法 (REGENIE,VariantSpark) 在发现CAD风险位置方面具有优越的灵敏度,包括rs28451064在21q22.11.
- 通过优化云计算策略实现了44%的成本降低和94%的数据分析速度提升.
结论:
- 先进的计算技术和机器学习对于大型生物库规模的基因组分析至关重要.
- 优化的云计算工作流程,如RAPOET,使大数据集的可扩展和成本效益分析成为可能.
- 这些发现为利用大型生物库数据为遗传发现和个性化医学提供了基础.
更多相关视频
09:34Targeted Next-generation Sequencing and Bioinformatics Pipeline to Evaluate Genetic Determinants of Constitutional Disease
Published on: April 4, 2018
33.4K
11:35Screening for Functional Non-coding Genetic Variants Using Electrophoretic Mobility Shift Assay EMSA and DNA-affinity Precipitation Assay DAPA
Published on: August 21, 2016
12.9K
