【问题标题】:Prediction value in sample tree made by H2O random forestH2O随机森林生成的样本树中的预测值
【发布时间】:2023-03-27 09:25:01
【问题描述】:

目前我正在通过 H2O 包做一个随机森林,并为演示目的绘制了一个示例树。每个节点的预测值与该节点所有实例的正类概率并不完全相同。

只是想知道 H2O 如何计算预测值。我需要一个公式来得出这个预测!我知道随机森林超过了树木预测的平均值。但是这个预测是如何在每棵树的每个节点上计算出来的呢?

任何帮助将不胜感激。

【问题讨论】:

  • 任何方式的节点,我的意思是叶节点????

标签: random-forest h2o


【解决方案1】:

我找到了一个解决方案,它返回训练数据集的确切概率作为样本树中的预测值。你只需要设置你的代码如下: h2o.randomforest(sample_rate = 1, calibrate_model = TRUE, and calibration_frame = train )

【讨论】:

    【解决方案2】:

    参见《统计学习要素》中的算法 15.1:

    然后看H2O-3中模型训练过程的实现代码:

    最后,了解实际生成的模型如何用于生成分数的最佳方法是您可以在此处找到的 genmodel MOJO 实现(尝试使用 java 调试器单步执行对 score0() 的调用):

    【讨论】:

    • 感谢您的回复,但算法正在讨论聚合过程,这不是我的问题。我正在寻找预测值,它是 [0,1] 区间之间的数字,并且仅出现在样本树的叶节点处。
    • 为了说清楚,我用一棵树运行了我的h20随机森林,看看叶子节点中的预测值是否与概率基本相同但它们不一样!\
    • 这里绘制了我正在谈论的示例树h2o.ai/blog/finally-you-can-plot-h2o-decision-trees-in-r
    • 我更新了上面的答案。在 genmodel 中尝试单步 score0()。
    • 谢谢汤姆。我仍然没有完全得到我的答案。我只需要解释这些数字代表什么。这就对了。那些是我的经理,他们不需要细节。我还有什么方法可以给我 R 版本的代码,因为我不使用 python
    猜你喜欢
    • 2021-03-21
    • 2014-08-07
    • 2018-07-12
    • 2022-12-17
    • 2019-07-22
    • 2017-12-04
    • 2019-05-04
    • 2016-11-10
    相关资源
    最近更新 更多