对于罕见疾病的可解释机器学习框架:在儿童白血病中对感染风险进行分层的案例研究
Irfan Al-Hussaini1,2, Brandon White1,3, Armon Varmeziar1,3
1Laboratory for Pathology Dynamics, Georgia Institute of Technology and Emory University, Atlanta, GA 30332, USA.
Journal of clinical medicine
|March 28, 2024
概括
这项研究开发了一种可解释的机器学习 (ML) 框架,用于预测儿科急性髓性白血病 (AML) 和急性淋巴细胞白血病 (ALL) 的治疗相关感染,实现准确的风险分类和确定关键预测特征.
科学领域:
- 计算生物学是一种计算生物学.
- 机器学习在罕见疾病中的应用.
- 儿科瘤学 儿科瘤学
背景情况:
- 罕见疾病数据集,例如儿科急性髓性白血病 (AML) 和急性淋巴细胞白血病 (ALL) 的数据集,由于样本大小小,对机器学习 (ML) 提出了挑战.
- 开发用于罕见疾病的有效ML模型需要专门的框架,可以处理有限的数据.
研究的目的:
- 创建一个可解释的ML框架,从小的,表式的罕见病数据集中提取可操作的见解.
- 应用这个框架来预测儿科AML和ALL的治疗相关感染.
主要方法:
- 该框架将优化数据归算和采样与监督和无监督学习技术相结合.
- 使用SemNet 2.0的基于文献的发现 (LBD) 用于识别额外的预测特征.
- 开发了可解释的ML模型,包括决策树和回归模型.
主要成果:
- 一个可解释的决策树在分类儿童ALL和AML的感染风险 (高/低) 中获得了约79%的准确性.
- 回归模型预测了细菌和病毒感染的数量,平均绝对误差分别为2.26和1.29.
- 关键的预测特征包括化疗方案,中枢神经系统参与,白血病类型和唐氏综合征. 作为额外的预测因素,LBD确定了葡萄糖,铁和生长因素.
结论:
- 开发的ML框架提供了来自罕见疾病数据集的最新,可解释的预测.
- 这项研究建立了基线ML模型的性能,用于预测儿科AML和ALL的感染.
- 该框架展示了在罕见的儿科癌症中推进ML应用的潜力.


