【问题标题】:h2o.ai Platt Scaling calibrationh2o.ai Platt 标定标定
【发布时间】:2018-02-20 15:58:27
【问题描述】:

我注意到 h2o.ai 套件中新增了一个相对较新的功能,即执行补充 Platt Scaling 以改进输出概率校准的能力。 (请参阅calibrate_model in h2o manual。)不过,在线帮助文​​档中提供的指导很少。特别是我想知道何时启用 Platt Scaling:

  • 它如何影响模型的排行榜?也就是说,platt scaling是在排名指标之后还是之前计算的?
  • 它如何影响计算性能?
  • calibration_frame 可以与validation_frame 相同还是不应该(从计算或理论的角度来看)?

提前致谢

【问题讨论】:

    标签: h2o calibration


    【解决方案1】:

    校准是模型完成后运行的后处理步骤。因此它不会影响排行榜,也不会影响训练指标。它在评分框架中再增加 2 列(带有校准的预测)。

    This article 提供如何构建校准框架的指导:

    1. 将数据集拆分为测试和训练
    2. 将训练集拆分为模型训练和校准。

    它还说: 最重要的一步是创建一个单独的数据集来执行校准。

    我认为校准框架应仅用于校准,因此与验证框架不同。保守的答案是它们应该是分开的——当您使用验证框架进行提前停止或任何内部模型调整(例如 H2O GLM 中的 lambda 搜索)时,该验证框架成为“训练数据”的扩展,所以它有点像那个时候是禁区。不过你可以试试这两个版本,直接观察效果如何,然后再做决定。以下是文章中的一些额外指导:

    “用于校准的数据量取决于您可用的数据量。校准模型通常只拟合少量参数(因此您不需要大量数据) . 我的目标是大约 10% 的训练数据,但至少至少 50 个示例。”

    【讨论】:

    • 感谢 Erin 的指导。我建议将其合并到 h2oai 文档中,至少以合成格式
    猜你喜欢
    • 2018-11-17
    • 1970-01-01
    • 2019-01-14
    • 1970-01-01
    • 1970-01-01
    • 2015-11-20
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多