Related Experiment Video
Updated: Jul 19, 2026

Tick Microbiome Characterization by Next-Generation 16S rRNA Amplicon Sequencing
Published on: August 25, 2018
Effects of data transformation and model selection on feature importance in microbiome classification data
Zuzanna Karwowska1,2,3, Oliver Aasmets4,
1Małopolska Centre of Biotechnology, Jagiellonian University, Krakow, Poland.
Machine learning accurately classifies host health from gut microbiome data, regardless of data transformation. Feature importance varies, cautioning against relying solely on machine learning for biomarker discovery.
Area of Science:
- Microbiome research
- Computational biology
- Machine learning applications
Background:
- Accurate host phenotype classification from microbiome data is vital for developing microbiome-based therapies.
- Gut microbiome data presents challenges like sparsity, compositionality, and population-specificity.
- The impact of microbiome data transformations on machine learning tasks remains largely unexplored.
Purpose of the Study:
- To investigate the effect of microbiome data transformations on machine learning classification accuracy and feature selection.
- To assess the robustness of machine learning models across different data transformations.
- To evaluate the implications for machine learning-based biomarker identification in microbiome research.
Main Methods:
- Analysis of over 8500 samples from 24 shotgun metagenomic datasets.
- Comparison of classification performance using various microbiome data transformations (e.g., presence-absence vs. abundance-based).
- Evaluation of feature importance variation across different transformations.
Main Results:
- Host health classification (healthy vs. diseased) is achievable with minimal dependence on specific algorithms or data transformations.
- Presence-absence transformations perform comparably to abundance-based transformations.
- Accurate classification requires only a small subset of predictors, but feature importance varies significantly across transformations.
Conclusions:
- Microbiome data transformations impact feature selection more than classification accuracy.
- Classification performance is robust across different transformations, but feature selection variability requires caution in biomarker identification.
- This study offers insights into applying machine learning to microbiome data and highlights future research directions.
Related Concept Videos
Modern Molecular Taxonomy
Applications of Molecular Taxonomy
Evolution of New Traits in Microbes
Methods to Assess Microbial Communities
Introduction to the Human Microbiota
Microbiota Modulation by Antibiotics

