使用SHAP的可解释机器学习识别了与年龄相关的神经和代谢条件的多因素光谱中的关键生物标志物
Daniil V Artamonov1,2, Polina I Popova3, Ekaterina A Korf4
1Group of Theoretical Chemistry, N.D. Zelinsky Institute of Organic Chemistry of Russian Academy of Sciences, Leninsky Prospect 47, Moscow 119991, Russia.
International journal of molecular sciences
|February 27, 2026
概括
这项研究强调了变异感知机器学习如何改善老年人血管和代谢疾病的诊断. 可解释模型可以识别铁和葡萄糖等关键生物标志物,以获得更好的诊断准确性.
科学领域:
- 生物医学数据分析
- 老年医学 老年医学
- 机器学习在医疗保健中的应用
背景情况:
- 老年人的血管和代谢障碍,包括中风和糖尿病,很难用标准的血液检查来诊断.
- 多参数血液化学分析对于这些情况至关重要但复杂.
- 生物化学特征变异的异质性可能会扭曲传统的统计分析.
研究的目的:
- 评估机器学习模型,用于诊断老年人的血管和代谢疾病.
- 使用可解释的人工智能识别关键的生化生物标志物及其相互作用.
- 评估差异感知统计方法对诊断准确性的影响.
主要方法:
- 在120名患有血管/代谢疾病的老年患者中分析了49个生化特征.
- 应用差异感知统计测试来识别具有异质差异的特征.
- 开发并比较了标准的ML分类器,一个梯度增强模型 (最大深度=3),以及KMeans集群.
- 使用Shapley添加式解释 (SHAP) 来实现模型的可解释性.
主要成果:
- 梯度增强模型实现了高分辨准确度 (F1分数为0.87-0.96).
- 由SHAP识别的关键生物标志物包括铁 (Fe),转激素和葡萄糖,显示出协同作用.
- 差异感知测试显示了Fe,Transf,RDW%和LDL等特征的显著异质性.
- 无监督的KMeans集群显示,与临床标签的一致性很差 (ARI=0.198,NMI=0.286).
结论:
- 可解释的机器学习,特别是限制深度的梯度增强,提高了老年人血管和代谢疾病的诊断可靠性.
- 变异感知统计方法对于处理生化数据异质性至关重要.
- 生物标志物相互作用,例如铁,转移素和葡萄糖之间的相互作用,对于准确的诊断很重要.


