谁是你的数据? 通过机器学习和USIDNET注册表的数据挖掘来预测一次性免疫缺陷差异诊断
Jose Alfredo Méndez Barrera1, Samuel Rocha Guzmán1, Elisa Hierro Cascajares2
1Data Science Department, Autonomous Technological Institute of Mexico, Mexico City, Mexico.
Clinical immunology (Orlando, Fla.)
|September 7, 2023
概括
机器学习使用患者数据准确预测原发性免疫缺陷 (PID) 诊断. 这项概念验证研究强调了计算工具的潜力,以帮助临床医生诊断罕见疾病.
科学领域:
- 计算生物学是一种计算生物学.
- 免疫学 免疫学 免疫学
- 数据科学是数据科学.
背景情况:
- 超过480种原发性免疫缺陷疾病 (PID) 影响全球数以百万计的人,造成诊断挑战.
- 罕见疾病总体影响大约每17个人中就有1人.
- 数据挖掘和机器学习为复杂的诊断提供了潜在的解决方案.
研究的目的:
- 使用监督机器学习算法预测原发性免疫缺陷 (PID) 诊断.
- 为了探索分类树促进PID诊断的实用性.
- 确定可预测PID的关键临床和实验室特征.
主要方法:
- 利用了USIDNET注册数据库,其中包括2396名患有常见PID诊断的患者.
- 使用XGBoost (极端梯度提升) 进行监督分类和SHAP进行特征重要性.
- 将数据划分为训练和测试集,使用scale_pos_weight.weight纠正不平衡的分类.
主要成果:
- 该模型在常见可变免疫缺陷 (CVID) (训练:0.80,测试:0.76) 和其他诊断 (0.75-0.99) 中取得了高准确性.
- 对CVID的关键预测因素包括上呼吸道感染,喘,自身免疫力和低血.
- 对CVID的负面预测特征包括高IgE,生长延迟,,淋巴缺血和先天性心脏病.
结论:
- 机器学习模型在预测PID诊断方面表现出有希望的表现.
- 功能重要性分析可以指导未来的研究和临床决策.
- 这项概念验证研究为开发用户友好的诊断工具铺平了道路.


