Related Experiment Video
Updated: Apr 10, 2026

08:40
Quantitation of Protein Expression and Co-localization Using Multiplexed Immuno-histochemical Staining and Multispectral Imaging
Published on: April 8, 2016
12.7K
Automatic sequence identification in multicentric prostate multiparametric MRI datasets for clinical machine-learning
José Guilherme de Almeida1, Ana Sofia Castro Verde2, Carlos Bilreiro3
1Champalimaud Foundation, Lisbon, Portugal. jose.almeida@research.fchampalimaud.org.
Insights Into Imaging
|March 27, 2025
Summary
Accurate machine learning models can automatically identify prostate cancer MRI sequences, streamlining data curation. Including center-specific data is crucial for optimal performance in multi-center studies.
Area of Science:
- Radiology and Medical Imaging
- Machine Learning in Healthcare
- Prostate Cancer Diagnostics
Background:
- Organizing large multi-centric multiparametric MRI (mpMRI) datasets for prostate cancer (PCa) machine learning (ML) is time-consuming.
- Accurate sequence-type identification is essential for curating these datasets to train robust clinical ML models.
Purpose of the Study:
- To develop and validate an accurate ML method for automatic sequence-type identification in multi-centric PCa mpMRI datasets.
- To create knowledge-based heuristics to further enhance automated series classification.
Main Methods:
- Retrospective classification of prostate mpMRI studies into five series types (T2W, DWI, ADC, DCE, others).
- Training of XGBoost and CatBoost models using metadata, with 5-fold cross-validation and learning curve analysis.
- Validation using hold-out and temporal test sets, and Leave-One-Group-Out cross-validation to assess center-specific effects.
Main Results:
- High test F1-scores (>0.95 for CatBoost, >0.97 for XGBoost) achieved.
- Models demonstrated learning saturation and temporal generalization capabilities for T2W/DWI/ADC triplets.
- Performance decreased when center-specific data was excluded, particularly for CatBoost, highlighting the need for such data.
Conclusions:
- Automatic sequence-type identification using ML is feasible and enables automated data curation for PCa mpMRI.
- While models generalize temporally, optimal performance necessitates the inclusion of dataset-specific data.
- Developed heuristics can assist researchers in series classification for PCa mpMRI datasets.

