Related Experiment Video
Updated: Jun 25, 2025

10:21
Author Spotlight: Streamlining Protein Target Prediction and Validation via Molecular Docking and CETSA
Published on: February 23, 2024
2.5K
Predicting the Predicted: A Comparison of Machine Learning-Based Collision Cross-Section Prediction Models for Small
Sara M de Cripan1,2,3, Trisha Arora1,2,3, Adrià Olomí1,2
1Computational Metabolomics for Systems Biology Lab, Eurecat─Technology Centre of Catalonia, Barcelona 08005, Catalonia, Spain.
Analytical Chemistry
|May 24, 2024
Summary
Machine learning models for collision cross-section (CCS) prediction in metabolomics show limited accuracy. Improved performance requires training data with many structurally similar molecules for reliable metabolite annotation.
Area of Science:
- Computational chemistry
- Analytical chemistry
- Metabolomics
Background:
- Machine learning (ML) is increasingly applied in -omics research due to large datasets.
- ML models predict tandem mass spectrometry and retention time in metabolomics.
- New ML models predict collision cross-section (CCS) using ion mobility data, but face limitations.
Purpose of the Study:
- To compare existing ML-based CCS prediction models using the METLIN-CCS dataset.
- To evaluate ML models trained with fingerprints and simple linear models.
- To analyze the impact of training data structural diversity on CCS prediction accuracy and metabolite annotation.
Main Methods:
- Comparison of four existing ML-based CCS prediction models.
- Evaluation against linear models and ML models using fingerprints.
- Analysis of prediction accuracy using the METLIN-CCS dataset.
- Exploration of training data structural diversity's role.
Main Results:
- Existing ML models demonstrated limited accuracy for routine metabolomics analysis.
- Prediction accuracy improved significantly only when models were trained on large sets of structurally similar molecules.
- Current models have restricted capabilities for metabolite annotation using CCS values.
Conclusions:
- Current ML-based CCS prediction models are insufficient for routine metabolomics.
- Training data heterogeneity, with large hubs of similar molecules, is crucial for enhanced prediction and annotation.
- Future advancements require diverse datasets focusing on structurally related compound classes.

