基于机器学习的模型用于查贫血和白血病,使用完整血清报告的功能
Hafsa Amjad1, Zamir Hussain1, Mahnoor Hasan1
1Department of Sciences, School of Interdisciplinary Engineering and Sciences (SINES), National University of Sciences and Technology (NUST), Islamabad, 44000, Pakistan.
Scientific reports
|September 30, 2025
概括
机器学习模型使用完整血清 (CBC) 数据有效地选贫血和白血病. 虽然随机森林模型实现了98%的准确性,但其通用性需要进一步优化,以便更广泛的临床应用.
科学领域:
- 血液学 血液学 血液学
- 医疗信息学 医疗信息学
- 机器学习 机器学习
背景情况:
- 完整的血清 (CBC) 报告对于血液学疾病查至关重要.
- 疾病重叠和主观CBC评估可能会导致诊断挑战.
- 机器学习 (ML) 为高效的CBC特征分析提供了解决方案.
研究的目的:
- 开发和评估使用CBC数据进行贫血和白血病查的ML模型.
- 通过利用混合合成数据来应对小样本大小的挑战.
- 确定关键的CBC特征,以准确预测疾病.
主要方法:
- 生成混合合成数据以增加一个小样本大小 (N=287).
- 选择了14个统计和临床相关的CBC特征 ("指纹").
- 实施和测试六个ML模型:决策树,随机森林,SVM,后勤回归,GBM和MLP.
主要成果:
- 随机森林模型表现出高性能,98%的准确性,97%的精度,98%的回忆率和99%的特异性.
- 该模型在所有类别中实现了2%的低失误率.
- 外部验证显示普遍性降低,在不同的人口数据集上准确度为74%.
结论:
- 机器学习模型,特别是随机森林模型,显示了使用CBC特征有效查贫血和白血病的前景.
- 混合合成数据生成是克服血液学研究中小样本大小限制的可行方法.
- 需要进一步的研究,以提高模型通用性,以建立强大的临床支持系统.


