EN
返回档案库

案例库 · 研发与科研 · 技术决策 · 2001

随机森林:将众多噪声树平均成稳健预测器

Breiman 生长了数千棵随机化树并取平均,在保持每棵树强度的同时削减方差。

加州大学伯克利分校

解法

决策树准确但不稳定:数据的小变化会改变整棵树,且单棵树过拟合。Leo Breiman 在 2001 年的论文《随机森林》中通过构建森林而非单棵树来同时解决这两个问题。

每棵树在数据的自助采样样本上生长,每次分裂只考虑随机特征子集。随机性使树各异,自助采样使它们强壮。平均它们的投票抵消了个体误差。

Breiman 证明了泛化误差随森林增长而收敛,并取决于单棵树的强度与树间相关性。袋外样本提供内部误差、强度和重要性估计,且该方法在准确性与 AdaBoost 相当的同时,对噪声更具鲁棒性。

生效的原因

  • 自助采样使每棵树不同
  • 随机特征子集使误差去相关
  • 平均抵消方差而不增加偏差
  • 袋外数据提供免费误差估计
取得的成效生长多棵去相关树并取平均聪明

可借鉴之处

如果某个模型脆弱,别再寻找完美模型:对多个刻意随机化的版本取平均。当集成抵消噪声时,单棵树的噪声没问题,且随机性比调参更廉价。

后续进展

随机森林成为最广泛使用的开箱即用机器学习方法之一,在深度学习接管图像和文本任务后仍保持竞争力,其思想也塑造了后续的梯度提升集成方法。

资料来源

发现哪里写错了?告诉我们。

相关案例