STLBRF:基于基因表达数据特征查标准化值的改进随机森林算法
Huini Feng1, Ying Ju2, Xiaofeng Yin3
1School of Mathematics and Statistics, Southwest University, Chongqing, China.
Briefings in functional genomics
|December 30, 2024
概括
一个新的基于标准化值和循环的随机森林 (STLBRF) 算法可以从杂的生物统计数据中改进基因选择. 这种方法提高了对选定特征基因的准确性和控制,提供了可靠的生物标志物发现.
科学领域:
- 生物统计学 生物统计学
- 生物信息学是一种生物信息学.
- 机器学习 机器学习
背景情况:
- 传统的随机森林 (RF) 算法在特征选择中与噪声和参数干扰作斗争.
- 直接消除噪音可以在生物统计分析中引入显著的偏差.
- 准确的特征基因选择对于生物标志物发现和表达分析至关重要.
研究的目的:
- 开发一个改进的随机森林算法,用于强大的特征基因选择.
- 解决传统射频在处理杂基因表达数据方面的局限性.
- 提高生物统计应用中特征选择的准确性和控制.
主要方法:
- 开发了一个新的基于标准化值和循环的随机森林 (STLBRF) 算法.
- 集成的倒退消除和K折交叉验证,具有标准化的错误增量值.
- 通过使用三个真实基因表达数据集,将STLBRF与,拉索,弹性网和传统RF进行比较.
主要成果:
- 与现有方法相比,STLBRF在特征基因选择方面表现出更高的有效性.
- 该算法可以更好地控制所选特征基因的数量.
- 使用随机森林分类器的验证证实了STLBRF选择基因的可靠性.
结论:
- 该STLBRF算法提供了一个强大的解决方案,用于特征基因选择在存在噪声.
- 该方法为特征表达分析和生物标志物研究提供了可靠的技术支持.
- STLBRF提高了基因选择的准确性和可控性,克服了传统的RF限制.


