在使用机器学习技术来改善诊断的血患者中疾病风险的分层
Anna Drożdż1, Brian Duggan2, Mark W Ruddock3
1Personal Health Data Science Group, Sano - Centre for Computational Personalised Medicine - International Research Foundation, Krakow, Poland.
Frontiers in oncology
|May 23, 2024
概括
机器学习算法,特别是CACTUS,可以通过分析多个生物标志物来改善血诊断. 这种方法有助于识别个性化诊断的患者特定标记,即使在不平衡的数据集.
科学领域:
- 计算生物学和生物信息学
- 医疗诊断和机器学习
背景情况:
- 诊断出血需要进行侵入性调查,因为患者人群不平衡和各种原因而复杂化.
- 鉴定患者特异性生物标志物是具有挑战性的,但对于准确的血液分类至关重要.
- 先进的分析方法,包括多标记分析,可以提高不平衡数据集的诊断准确性.
研究的目的:
- 应用机器学习算法来分类血液病患者队列 (HaBio) 中的患者.
- 确定最相关的生物标志物,以区分健康和患有血的病人.
- 为了比较各种机器学习模型在处理不平衡数据集的性能.
主要方法:
- 利用k-means集群,决策树,随机森林与LIME解释器,以及用于患者分层的CACTUS算法.
- 将患者分为健康 (没有明确的原因) 或生病 (确定的原因,例如膀癌,感染) 的组.
- 分析了分类模型的性能和已识别的生物标志物的病理相关性.
主要成果:
- 随机森林和决策树由于数据集不平衡,表现不佳,高估了"病态"类.
- CACTUS算法证明了对数据不平衡的稳定性,总体达到0.747的平衡精度.
- 确定的关键生物标志物包括微专蛋白,男性性别和tPSA对于一般队列;具体标志物因性别而异.
结论:
- 在分类出血症患者方面,CACTUS算法表现优于决策树和随机森林,特别是在数据不平衡的情况下.
- 确定了不同患者亚组的特定,相关的生物标志物,表明了新型诊断标志物的潜力.
- 结果支持基于个体患者个人资料的血个性化诊断方法的开发.


