在前列腺癌中识别潜在的生物标志物微阵列基因表达利用可解释的机器学习分类器
Ahmed Al Marouf1, Jon George Rokne1, Reda Alhajj1,2,3
1Department of Computer Science, University of Calgary, Calgary, AB T2N 1N4, Canada.
Cancers
|December 11, 2025
概括
这项研究引入了可解释的机器学习 (XML) 来识别前列腺癌生物标志物. 这种新的方法使用随机森林实现了81.01%的准确性,精确地确定了个性化瘤学的关键基因.
科学领域:
- 生物信息学和计算生物学
- 在瘤学瘤学.
- 机器学习 机器学习
背景情况:
- 前列腺癌的诊断和严重程度分层对于个性化治疗至关重要.
- 传统的生物标志物发现缺乏透明度,阻碍了临床信任.
- 生物信息学提供了工具,但解释性仍然是一个挑战.
研究的目的:
- 开发和验证一种可解释的机器学习 (XML) 方法来识别和优先考虑前列腺癌生物标志物.
- 提高机器学习模型在生物信息学中的可解释性,用于临床决策.
- 发现严重性特定的基因生物标志物,以改善前列腺癌管理.
主要方法:
- 实现了各种机器学习分类器 (原始贝叶斯,随机森林,决策树,SVM,物流回归,包装).
- 使用SHAP (夏普利添加式解释) 值来解释模型的可解释性.
- 应用数据预处理技术,包括归算,SMOTE和Tomek链接用于类不平衡,以及k-fold分层验证.
主要成果:
- 使用随机森林模型实现了最高准确率81.01%.
- 确定了十种潜在的基因生物标志物:DEGS1,HPN,ERG,CFD,TMPRSS2,PDLIM5,XBP1,AJAP1,NPM1和C7. 这些基因生物标志物包括:DEGS1,HPN,ERG,CFD,TMPRSS2,PDLIM5,XBP1,AJAP1,NPM1和C7.
- 在102名患者的组织微阵列数据集上验证了模型.
结论:
- 可解释的机器学习 (XML) 能够有效地识别前列腺癌中的严重性特定生物标志物.
- 这种方法支持精确瘤学,使得有针对性的干预措施.
- 这些发现预示着前列腺癌患者个性化护理的新时代.


