Related Experiment Video
Updated: Jan 12, 2026

Inverse Probability of Treatment Weighting Propensity Score using the Military Health System Data Repository and National Death Index
Published on: January 8, 2020
Resampling methods for class imbalance in clinical prediction models: A scoping review protocol.
Osama Abdelhay1, Adam Shatnawi2, Hassan Najadat2
1Department of Data Science and Artificial Intelligence, Princess Sumaya University for Technology, Amman, Jordan.
This review synthesizes 15 years of research on resampling strategies for imbalanced clinical datasets. It aims to identify which methods reliably improve medical AI model performance, addressing a critical gap in medical artificial intelligence.
Area of Science:
- Medical Artificial Intelligence (AI)
- Machine Learning in Healthcare
- Clinical Prediction Modeling
Background:
- Class imbalance in clinical datasets (<30% positive cases) hinders medical prediction model sensitivity and fairness.
- Existing data-level (e.g., SMOTE) and algorithm-level (e.g., cost-sensitive learning) strategies lack comprehensive empirical evidence for effectiveness.
- This scattered evidence across diseases and models creates a methodological gap in reliable medical AI.
Purpose of the Study:
- To conduct a scoping systematic review with meta-regression on resampling strategies for imbalanced clinical data.
- To map and quantitatively summarize 15 years of research (2009-2024) on these strategies.
- To address the methodological gap concerning the reliable improvement of medical AI performance.
Main Methods:
- Systematic search of major databases (MEDLINE, EMBASE, Scopus, Web of Science, IEEE Xplore) and pre-print servers.
- Inclusion of primary studies applying resampling or cost-sensitive strategies to binary clinical prediction tasks with <30% minority class prevalence.
- Descriptive synthesis and random-effects meta-regression (logit-transformed AUC) to analyze moderator effects (imbalance ratio, strategy, model, sample size).
Main Results:
- A comprehensive catalog of clinical domains, sample sizes, imbalance ratios, strategies, model types, and performance metrics (AUC) will be compiled.
- Meta-regression will quantify the impact of various factors on model performance.
- Analyses will assess small-study effects and robustness using established statistical methods.
Conclusions:
- Determine when data-level versus algorithm-level balancing genuinely improves discrimination, calibration, and cost-sensitive metrics.
- Provide evidence-based guidance for selecting imbalance-handling methods in medical AI research.
- Inform reporting standards and identify research gaps, particularly in calibration and misclassification costs, for trustworthy AI in clinical practice.
Related Concept Videos
Types of Biopharmaceutical Studies: Controlled and Non-Controlled Approaches
Non-controlled studies, commonly employed for initial exploration, lack a control group, rendering them susceptible to biases and external influences. In contrast,...
Strategies for Assessing and Addressing Confounding
Confounding can be addressed at both the design phase of a study and through analytical methods after data...
Bias in Epidemiological Studies
Randomized Experiments
Simple randomization
Simple...
Bootstrapping
Regression Toward the Mean

