一种基于整体学习的特征选择算法,用于识别细胞癌的生物标志物
PeerJ. Computer science
|January 10, 2024
概括
本研究介绍了EFS-GINI,这是一种基于集体学习的特征选择方法,用于高维数据. 它提高了分类的准确性和速度,识别细胞癌中的关键基因.
科学领域:
- 机器学习 机器学习
- 生物信息学是一种生物信息学.
- 数据科学数据科学数据科学
背景情况:
- 特性选择对于分类至关重要,但对于高维数据来说具有挑战性.
- 传统的方法在高维数据集中的计算复杂性方面扎.
- 合体学习在机器学习分类任务中提供了强大的性能.
研究的目的:
- 为高维数据提出一个高效和有效的基于三阶段集体学习的特征选择算法 (EFS-GINI).
- 为了提高分类准确性和模型学习速度.
- 探索癌症数据集中所选特征的生物学意义.
主要方法:
- 使用斯皮尔曼系数,F测试,相互信息,ReliefF,SURF,SURF*和GINI系数的三个阶段的特征选择框架 (EFS-GINI).
- 使用决策树,天真贝叶斯,SVM,KNN和随机森林进行集体分类,采用软投票方法.
- 在八个高维数据集和细胞癌数据集 (GSE40435) 上的应用.
主要成果:
- 与现有方法相比,EFS-GINI显著提高了特征选择的准确性和速度.
- 该算法确定了两个关键基因 (NOP2,NSUN5),涉及细胞癌中m5CRNA修饰.
- 生物信息学分析证实了m5C相关基因在细胞癌进展中的作用.
结论:
- EFS-GINI是高维数据的有效特征选择方法,提高了分类性能.
- 鉴定的基因和途径突出显示了细胞癌预后的潜在生物标志物.
- 合体学习为生物信息学中复杂的特征选择问题提供了一种强大的方法.
更多相关视频
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.8K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.3K
