开发一种可解释的机器学习模型,以预测新生儿查中的假阴性素缺乏病例
Peiyao Wang1, Haomin Li2, Xinjie Yang1
1Department of Genetics and Metabolism, Children's Hospital of Zhejiang University School of Medicine, National Clinical Research Center for Child Health, No. 3333 Binsheng Road, Binjiang District, Hangzhou City, 310052, Zhejiang Province, China.
Orphanet journal of rare diseases
|October 9, 2025
概括
这项研究开发了一种可解释的机器学习模型,用于在新生儿查期间识别由素缺乏症 (NICCD) 引起的新生儿肝内胆固醇衰竭的假阴性病例. 该模型改善了NICCD的早期检测,增强了查系统.
科学领域:
- 生物化学 生物化学
- 遗传学 是一个遗传学.
- 医疗信息学 医疗信息学
背景情况:
- 新生儿肝脏内胆固醇症由素缺乏引起 (NICCD) 是一种遗传性代谢障碍.
- 标准新生儿查 (NBS) 对于NICCD可以产生错误的负结果由于正常的素水平,延迟诊断.
- 早期发现NICCD对于及时干预和改善患者结果至关重要.
研究的目的:
- 开发和验证一个可解释的机器学习 (ML) 模型,用于预测虚假阴性NICCD病例.
- 为了确定NICCD超越标准选参数的关键预测特征.
- 为了提高NICCD的NBS的准确性和有效性.
主要方法:
- 追溯分析了53名NICCD患者和212名对照组的数据.
- 开发和评估六个ML模型,包括XGBoost,使用代谢物和人口统计数据.
- 应用SHAP (沙普利增量解释) 模型解释性和特征重要性分析.
主要成果:
- 在预测假阴性NICCD病例方面,XGBoost模型实现了高性能 (AUC> 0.97,F1得分> 0.83).
- 关键的预测特征包括出生体重,素,甘氨酸,氨酸,鸟类素和氨酸.
- SHAP分析为模型预测和特征相互作用提供了患者层面的见解.
结论:
- 使用代谢物和人口统计数据的可解释的ML模型显著改善了对虚假阴性NICCD病例的检测.
- 这种方法促进了NICCD患者的早期识别和干预.
- 开发的模型和计算器增强了新生儿代谢障碍的整体查系统.


