Development and validation of an interpretable machine learning model using routine laboratory biomarkers to stratify

Wei Cui1, Xinlv Zhang2, Yang Chen2

  • 1Anhui Provincial Children's Hospital, Hefei, Anhui, China; National Children's Regional Medical Center, Hefei, Anhui, China; Anhui Clinical Medical Research Center for Child Health and Diseases, Hefei, Anhui, China; Anhui Institute of Pediatric Medicine, Hefei, Anhui, China.

PubMed

Insights

This study developed an interpretable machine learning model to diagnose severe pneumonia in children and predict their risk of progression using routine lab tests. The CatBoost model aids early intervention, especially in resource-limited settings.

Area of Science:

  • Pediatric critical care medicine
  • Biomarker discovery
  • Machine learning in healthcare

Background:

  • Severe pneumonia is a major global cause of mortality in children under five.
  • Accurate risk stratification tools for early identification of severe pneumonia are lacking.

Purpose of the Study:

  • To develop an interpretable machine learning (IML) model for diagnosing severe pneumonia at admission.
  • To predict the risk of pneumonia progression during hospitalization using routine laboratory biomarkers.

Main Methods:

  • Retrospective analysis of 85,886 children with pneumonia from a Chinese tertiary hospital (2013-2023).
  • Utilized 57 laboratory parameters from electronic health records for model development.
  • Evaluated nine machine learning algorithms, focusing on CatBoost, with SHapley Additive exPlanations (SHAP) for interpretability.

Main Results:

  • The CatBoost model, using 11 laboratory features, achieved an AUC of 0.879 for diagnosis and 0.839 for progression prediction.
  • Optimized key feature thresholds (e.g., chloride ≤ 99 mmol/L) using Youden's index.
  • A real-time web application with case-level interpretability was developed.

Conclusions:

  • An interpretable CatBoost model effectively stratifies pediatric severe pneumonia risk using routine laboratory data.
  • Clinical implementation via a web tool can support early intervention, particularly in resource-limited settings.
  • External validation is recommended for broader applicability.
Abstract