Related Experiment Video
Updated: Jun 27, 2025

08:51
Author Spotlight: Integrated Multi-Omics Analysis for Unveiling Multicellular Immune Signatures in Clinical Heart Attack Cohorts
Published on: September 20, 2024
1.2K
Exploring machine learning strategies for predicting cardiovascular disease risk factors from multi-omic data
Gabin Drouard1, Juha Mykkänen2,3, Jarkko Heiskanen2,3
1Institute for Molecular Medicine Finland (FIMM), HiLIFE, University of Helsinki, Helsinki, Finland. gabin.drouard@helsinki.fi.
BMC Medical Informatics and Decision Making
|May 2, 2024
Summary
Machine learning models can predict cardiovascular disease (CVD) risk factors using omics data. Multi-omics and semi-supervised autoencoders improved prediction accuracy, offering a platform for evaluating different strategies.
Area of Science:
- Bioinformatics
- Computational Biology
- Genomics
Background:
- Machine learning (ML) classifiers are increasingly used for predicting cardiovascular disease (CVD) and related risk factors using omics data.
- Challenges include categorical outcomes and class imbalances, with limited understanding of factors influencing prediction quality.
Purpose of the Study:
- To compare different machine learning strategies for predicting CVD risk factors.
- To evaluate the influence of ML classifiers, omics data types, and dimension reduction techniques on prediction quality.
Main Methods:
- Compared six ML classifiers using blood-derived metabolomics, epigenetics, and transcriptomics data.
- Utilized unsupervised and semi-supervised autoencoders for omics dimension reduction.
- Constructed multi-omic predictions using a meta-learner and evaluated performance using F1 score.
- Investigated transfer learning with pre-trained autoencoders on an external cohort.
Main Results:
- Multi-omics predictions generally outperformed single-omics predictions, especially for extreme risk factor levels.
- Semi-supervised autoencoders enhanced downstream predictions compared to unsupervised methods.
- Transfer learning demonstrated median Area Under the Curve gains of 0.09-0.14 for transcriptomics and 0.07-0.11 for metabolomics.
Conclusions:
- The study provides a framework for researchers to assess the impact of omics data, ML classifiers, and dimension reduction on CVD risk factor prediction.
- Highlights the benefit of multi-omics integration and advanced dimension reduction techniques for improved predictive performance.

