案例库 · 研发与科研 · 技术决策 · 2001
随机森林:将众多噪声树平均成稳健预测器
Breiman 生长了数千棵随机化树并取平均,在保持每棵树强度的同时削减方差。
加州大学伯克利分校
解法
决策树准确但不稳定:数据的小变化会改变整棵树,且单棵树过拟合。Leo Breiman 在 2001 年的论文《随机森林》中通过构建森林而非单棵树来同时解决这两个问题。
每棵树在数据的自助采样样本上生长,每次分裂只考虑随机特征子集。随机性使树各异,自助采样使它们强壮。平均它们的投票抵消了个体误差。
Breiman 证明了泛化误差随森林增长而收敛,并取决于单棵树的强度与树间相关性。袋外样本提供内部误差、强度和重要性估计,且该方法在准确性与 AdaBoost 相当的同时,对噪声更具鲁棒性。
生效的原因
- 自助采样使每棵树不同
- 随机特征子集使误差去相关
- 平均抵消方差而不增加偏差
- 袋外数据提供免费误差估计
取得的成效生长多棵去相关树并取平均聪明
可借鉴之处
如果某个模型脆弱,别再寻找完美模型:对多个刻意随机化的版本取平均。当集成抵消噪声时,单棵树的噪声没问题,且随机性比调参更廉价。
后续进展
随机森林成为最广泛使用的开箱即用机器学习方法之一,在深度学习接管图像和文本任务后仍保持竞争力,其思想也塑造了后续的梯度提升集成方法。
资料来源
发现哪里写错了?告诉我们。