使用图形卷积神经网络和层级相关性传播进行稳定特征选择,用于发现乳腺癌中的生物标志物
Hryhorii Chereda1, Andreas Leha2, Tim Beißbarth3
1Medical Bioinformatics, University Medical Center Göttingen, Goldschmidtstraße 1, Göttingen, 37077, Germany.
Artificial intelligence in medicine
|April 24, 2024
概括
我们开发了一种使用图形卷积神经网络与层级相关性传播 (GCNN+LRP) 的新方法,以确定乳腺癌的稳定和可解释的预后基因列表,其性能优于其他机器学习方法.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 在瘤学中的机器学习
背景情况:
- 高通量技术对于发现预后生物标志物和乳腺癌等疾病的药物标至关重要.
- 现有的从机器学习方法获得的预后基因列表往往不稳定,缺乏生物解释性.
- 特征选择的不稳定性阻碍了对癌症病理学的一致相关基因的识别.
研究的目的:
- 提高特征选择在乳腺癌中预后生物标志物发现的稳定性和可解释性.
- 为了比较图形卷积神经网络与层级相关性传播 (GCNN+LRP) 与GCNN与夏普利增量扩展 (GCNN+SHAP) 和经典机器学习方法的性能.
- 引入一个系统的方法来定量分析所选特征集的稳定性,分类影响和可解释性.
主要方法:
- 利用图形卷积神经网络 (GCNN) 将分子网络信息与基因表达数据集成.
- 采用层级相关性传播 (LRP) 和夏普利添加式解释 (SHAP) 来解释深度学习模型决策和构建特征集.
- 开发并应用定量方法来评估特征集稳定性,分类性能和可解释性.
主要成果:
- 与GCNN+SHAP和传统机器学习方法相比,GCNN+LRP在识别预后基因列表方面表现出卓越的稳定性和可解释性.
- 使用SHAP的特征选择证明有效,当高分类性能是主要目标时.
- 提出的方法允许系统地比较不同的特征选择技术.
结论:
- GCNN+LRP提供了一种强大的方法,可以从高通量基因表达数据中生成稳定且生物可解释的预后基因列表.
- 这些发现强调了整合分子网络信息和先进的解释性方法对于可靠的生物标志物发现的重要性.
- 这项工作为推进机器学习在精密瘤学中的实用性提供了一个框架.


