optRF:通过确定最佳数量的树木来优化随机森林稳定性
Thomas M Lange1, Mehmet Gültas2,3, Armin O Schmitt4,3
1Breeding Informatics Group, Georg-August University, Margarethe Von Wrangell-Weg 7, 37075, Göttingen, Germany. thomas.lange@uni-goettingen.de.
随机森林是一种机器学习技术,可以从相同的数据中产生不同的模型. 本研究介绍了一种方法来量化这种非决定性,找到一个最佳的树数量,以实现稳定的预测和高效的计算.
科学领域:
- 机器学习 机器学习
- 数据科学数据科学数据科学
- 计算统计学 计算统计学
背景情况:
- 随机森林是一个著名的机器学习算法用于大数据分析.
- 随机森林的一个关键特征是它的非决定性性质,可能导致来自相同数据集的各种模型输出.
- 这种变化可能会对依赖这些模型的决策过程产生重大影响.
研究的目的:
- 开发一种方法来量化随机森林模型中非决定性的影响.
- 评估非确定性如何影响预测,变量重要性估计和后续决策.
- 为随机森林模型确定最佳数量的树木,以平衡稳定性和计算成本.
主要方法:
- 引入了一种新的方法来量化随机森林模型的非决定性.
- 分析了树木数量与模型稳定性之间的关系.
- 评估对预测和变量重要性估计的影响.
- 开发了R包optRF以建模树数稳定关系.
主要成果:
- 在随机森林中增加树木数量以非线性方式提高模型稳定性.
- 计算时间随着树的数量线性增加.
- 树的最佳数量存在,可以最大限度地稳定,而无需过度的计算开销.
结论:
- 随机森林中的非确定性需要仔细考虑,才能做出可靠的决策.
- R 包 optRF 提供了数据驱动的建议,以获得最佳树数.
- 通过优化树选择,可以实现平衡模型稳定性和计算效率.
更多相关视频
04:35Development of an Individual-Tree Basal Area Increment Model using a Linear Mixed-Effects Approach
Published on: July 3, 2020
12:27Large-scale Reconstructions and Independent, Unbiased Clustering Based on Morphological Metrics to Classify Neurons in Selective Populations
Published on: February 15, 2017
相关概念视频
Survival Tree
Building a Survival Tree
Constructing a...
Estimating Population Mean with Known Standard Deviation
The confidence interval estimate will have the form as follows:
(point estimate - error bound, point estimate +...
Randomized Experiments
Simple randomization
Simple...
Expected Frequencies in Goodness-of-Fit Tests
Bootstrapping
Goodness-of-Fit Test
