ieGENES:一种机器学习方法,用于在癌症研究中选择差异表达的基因
Xiao-Lei Xia1, Shang-Ming Zhou2, Yunguang Liu3
1Centre for Secure Information Technologies, Institute of Electronics, Communications & Information Technology, Queen's University Belfast, BT3 9DT, UK.
Journal of biomedical informatics
|March 2, 2025
概括
通过选择关键基因,ieGENES算法通过使用微阵列数据改进了癌症分类. 这种方法提高了诊断的准确性,并识别了差异表达基因 (DEGs) 用于生物标志物发现.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 癌症研究 癌症研究
背景情况:
- 精确的基因选择对于有效地从微阵列数据进行癌症分类至关重要.
- 高维微阵列数据带来了诸如多线性等挑战,影响了分类模型的稳定性.
- 现有的基因选择方法可能无法最佳地识别癌症诊断的相关基因.
研究的目的:
- 开发一种新的包装方法,即iGENES,用于改善癌症微阵列数据中的基因选择.
- 为了提高癌症分类的准确性,并识别差异表达基因 (DEGs) 用于生物标志物发现.
- 在高维数据中解决多对线性,使用节的内核机器规范化 (PKMR) 模型.
主要方法:
- 开发了ieGENES包装算法,用于最佳的基因识别和冗余基因消除.
- 采用了节的内核机器规范化 (PKMR) 模型,并采用了峰规范化来处理多线性.
- 雇员休假一次的交叉验证用于评估基因选择的准确性和更新模型参数.
主要成果:
- 在6个癌症微阵列数据集中的5个中,iGENES在基因选择准确度方面超过了现有的包装方法.
- 在分类准确度方面观察到统计学上显著的改善 (p<0.001).
- 在结肠癌数据集中,通过167个DEG实现了96.21%的准确性.
结论:
- ieGENES技术在识别用于癌症诊断的DEG方面表现出卓越的性能.
- 为分析微阵列数据和在癌症研究中发现生物标志物提供了一个有前途的工具.
- 提高了准确可靠的癌症分类的潜力.


