Related Experiment Video
Updated: Oct 19, 2025

Large-Scale Multi-Omics Genome-Wide Association Studies Mo-GWAS: Guidelines for Sample Preparation and Normalization
Published on: July 27, 2021
A New Pipeline for the Normalization and Pooling of Metabolomics Data
Vivian Viallon1, Mathilde His1, Sabina Rinaldi1
1Nutrition and Metabolism Branch, International Agency for Research on Cancer (IARC-WHO), 69008 Lyon, France.
Pooling metabolomics data enhances statistical power but faces challenges. A new pipeline normalizes and pools data by removing variability, improving comparability across studies for molecular epidemiology.
Area of Science:
- Molecular Epidemiology
- Bioinformatics
- Biostatistics
Background:
- Pooling metabolomics data across studies increases statistical power but faces challenges due to preanalytical and analytical variations.
- Differences in sample types, collection protocols, storage, and assay conditions can introduce significant variability between datasets.
- Existing methods struggle to effectively harmonize diverse metabolomics datasets for robust analysis.
Purpose of the Study:
- To develop and validate a novel computational pipeline for normalizing and pooling metabolomics data from multiple studies.
- To address and mitigate inter-study variability and biases in metabolomics datasets.
- To enhance the comparability and statistical power of multi-study metabolomics analyses.
Main Methods:
- A sequential pipeline involving data cleaning, outlier removal, and missing data imputation.
- Principal component partial R-square (PC-PR2) analysis to identify sources of variability.
- Linear mixed models to remove unwanted variability (study, batch) while preserving biological signals and accounting for residual variances.
Main Results:
- The pipeline successfully normalized and pooled targeted metabolomics data from eight European Prospective Investigation into Cancer and Nutrition (EPIC) studies.
- Demonstrated improved comparability of metabolomics measurements across diverse datasets.
- The method effectively reduced biases introduced by inter-study variability.
Conclusions:
- The developed pipeline provides a robust method for normalizing and pooling metabolomics data, enhancing its utility for large-scale analyses.
- This approach can be adapted for other molecular data types, including proteomics and biomarkers, facilitating multi-consortia data integration.
- The pipeline offers a valuable tool for molecular epidemiologists seeking to maximize insights from diverse biological datasets.
More Related Videos
07:34Large Scale Non-targeted Metabolomic Profiling of Serum by Ultra Performance Liquid Chromatography-Mass Spectrometry UPLC-MS
Published on: March 14, 2013
11:02Identification and Quantification of Deranged Metabolites in Critically Ill Patients Using NMR-Based Metabolomics
Published on: November 29, 2024