用机器学习生存模型和可统计解释技术来预测艾滋病毒发病率的细胞因子概况
Sarah Ogutu1, Mohanad Mohammed2,3, Henry Mwambi2
1School of Mathematics, Statistics and Computer Science, University of KwaZulu-Natal, Pietermaritzburg, 3201, South Africa. ogutusarah@gmail.com.
Scientific reports
|December 2, 2024
概括
机器学习模型,特别是随机生存森林,使用细胞因子概况有效预测HIV发病率. 这些模型的性能优于传统方法,识别了关键的炎症标志物和基线因素,以改善预防策略.
科学领域:
- 免疫学和传染病的研究
- 计算生物学和生物信息学
- 生物统计学和生存分析
背景情况:
- 人类免疫缺陷病毒 (HIV) 仍然是一个重大的全球卫生挑战,特别是在非洲.
- 艾滋病毒的预防策略正在不断发展,最近人们对细胞因子概况作为潜在的发病率预测因素产生了兴趣.
- 传统的统计模型面临着分析高维度,时间变化的细胞因子数据以分析艾滋病毒存活率的挑战.
研究的目的:
- 应用机器学习的生存模型,包括生存支持矢量机 (SSVM) 和随机生存森林 (RSF),以使用细胞因子数据预测HIV发病率.
- 在预测准确性 (C指数,IBS) 和变量重要性方面评估这些模型的性能.
- 用沙普利增量解释 (SHAP) 值来解释模型预测,并确定关键预测性细胞因子和基线因素.
主要方法:
- 利用SSVM和RSF模型与细胞因子水平 (平均值和差异) 作为HIV发病率的预测指标.
- 使用一致性指数 (C指数) 和综合布莱尔分数 (IBS) 评估模型性能.
- 采用SHAP值来解释模型的解释性,并通过废除研究确定了显著的细胞因子和基线因素.
主要成果:
- RSF模型表现出优于SSVM模型的性能,差异共变量模型的表现优于平均共变量模型.
- 使用差异共变量模型和日志等级分割规则,RSF获得的最高C指数为0.8801.
- 确定了关键细胞因子 (例如TNF-A,BASIC-FGF,IL-5) 作为积极的预测因子,以及重要的基线因素,如避孕套使用和伴侣数量.
结论:
- 细胞因子谱具有预测艾滋病毒发病率的巨大潜力,为增强的预防策略提供了新的途径.
- 与SSVM相比,随机生存森林对于分析高维度,时间变化的细胞因子数据是有利的.
- 共同变量模型中的特征选择对于平衡模型复杂性和HIV发病率预测中的预测准确性至关重要.


