特性归因的稳定性:对照放射病理学和TCGA结果的监督和无监督选择
1Faculty of Data Science, Musashino University, 3-3-3 Ariake Koto-ku, Tokyo, 135-8181, Japan.
Cancer letters
|November 14, 2025
概括
监督机器学习在瘤学中显示低特征选择稳定性. 无监督方法为特征的重要性提供了更高的可靠性,这表明在癌症研究中需要结合方法.
科学领域:
- 计算瘤学是一种计算瘤学.
- 生物信息学是一种生物信息学.
- 机器学习可以解释机器学习的解释性.
背景情况:
- 可解释机器学习 (IML) 在瘤学中对于理解复杂的生物数据至关重要.
- SHAP (夏普利添加式扩展) 常用于随机森林和XGBoost等监督模型中的特征归属.
- 有关特征归因的稳定性和潜在偏差存在担忧,这些属性仅来自监督学习中的SHAP.
研究的目的:
- 评估监督与无监督/非目标方法中的目标预测准确性和特征重要性的可靠性之间的权衡.
- 用癌症基因组图谱 (TCGA) 数据的特征消除测试来评估特征选择的稳定性.
- 为减轻瘤学可解释机器学习中的特定模型偏差提供建议.
主要方法:
- 对监督模型 (随机森林,XGBoost) 和无监督/非目标方法 (特征聚合,高度可变的基因选择,斯皮尔曼相关性) 的比较分析.
- 用特征消除测试来评估特征重要性估计的稳定性.
- 评估指标包括用于预测准确性和用于稳定性的特征保留率的曲线下接收器运行特征面积 (ROC-AUC).
主要成果:
- 监督模型在预测准确度上只显示了适度的改善 (例如,随机森林ROC-AUC:0.8851到0.8865).
- 监督模型的特征选择稳定性特别低 (随机森林:6/10,XGBoost:保留了3/10的特征).
- 无监督和非目标方法表现出高稳定性,保留了10/10的特征,具有一致的性能 (例如,特征聚合,高度可变的基因选择:0.8823).
结论:
- 监督机器学习模型虽然提供了轻微的预测收益,但在瘤学中遭受不稳定的特征重要性估计.
- 无监督和非目标方法提供了更可靠和更稳定的特征选择,这对于强大的生物洞察至关重要.
- 建议将无监督标准与因果推断和外部验证相结合,以提高IML的可靠性和减少IML在癌症研究中的偏差.


