随机森林算法对基因选择的性能评估,用于识别微阵列数据集中与可切除胰腺癌相关的基因:一项回顾性研究
Niloofar Rabiei1, Ali Reza Soltanian2, Maryam Farhadian3
1Department of Biostatistics, School of Public Health, Hamadan University of Medical Sciences, Hamadan, Iran.
Cell journal
|June 10, 2023
概括
这项研究使用K-最近邻居 (KNN) 对缺失数据和随机森林分析的归算来确定与胰腺癌 (PC) 相关的关键基因. 这些发现突出了21个重要的基因,有助于理解PC发育.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 癌症研究 癌症研究
背景情况:
- 微阵列数据通常包含缺失值 (MVs),使基因表达分析复杂化.
- 从大型数据集中识别疾病特异性基因是癌症研究的一个重大挑战.
研究的目的:
- 确定与胰腺癌 (PC) 相关的有效基因.
- 使用归算方法解决基因表达数据中缺失的值.
- 在PC中应用机器学习算法来进行基因选择.
主要方法:
- 使用了GSE14245数据集,其中包括12个PC和12个对照样本.
- 应用折叠改变技术来过29482个基因.
- 采用K-最近邻居 (KNN) 对缺失的基因表达值的归算.
- 使用随机森林算法选择PC相关基因.
- 使用支持矢量机 (SVM) 和天真贝叶斯 (NB) 分类器的分类数据.
主要成果:
- 确定了1185个具有折叠变化的基因> 3.
- 选择了21个与PC相关的非常重要的基因.
- S100P和GPX3被确定为分别具有最高和最低重要性的关键基因.
- 通过SVM (95.5%F-score) 和NB (93%F-score) 实现了高分类准确度.
结论:
- 折叠变化,KNN归算和随机森林的组合有效地识别了PC中的重要基因.
- 随机森林算法是发现新型疾病相关基因的强大工具.
- 这种方法可以发现以前在胰腺癌研究中被忽视的基因.


