【问题标题】:SGD model "overconfidence"SGD模型“过度自信”
【发布时间】:2013-01-27 01:05:44
【问题描述】:

我正在使用 Apache Mahout 解决二进制分类问题。我使用的算法是 OnlineLogisticRegression,而我目前拥有的模型强烈倾向于产生没有任何中间值的 1 或 0 预测。

请建议一种方法来调整或调整算法,使其在预测中产生更多的中间值。

提前致谢!

【问题讨论】:

    标签: machine-learning classification mahout


    【解决方案1】:

    分类器的测试错误率是多少?如果它接近于零,那么自信是一个特点,而不是一个错误。

    如果测试错误率很高(或至少不低),则分类器可能过度拟合训练集:测量训练错误和测试错误之间的差异。在这种情况下,按照 rrenaud 的建议增加正则化可能会有所帮助。

    如果您的分类器没有过度拟合,则概率校准可能存在问题。逻辑回归模型(例如,使用 logit 链接函数)应该产生足够好的概率校准(如果问题近似线性可分且标签不太嘈杂)。您可以按照this paper 中的说明使用绘图检查概率的校准。如果这确实是一个校准问题,那么实施基于 Platt 缩放或等渗回归的自定义校准可能有助于解决该问题。

    【讨论】:

      【解决方案2】:

      通过阅读Mahout AbstractOnlineLogisticRegression 文档,您似乎可以控制正则化参数 lambda。增加 lambda 应该意味着您的权重更接近于 0,因此您的预测更加对冲。

      【讨论】:

      • 是的,我玩过 lambda。如果值足以产生我想要的值,模型的准确性会大大降低。
      • 我有一个扩展正则化方法的想法,它不仅会在模型的权重值太高,而且如果它的预测值太高(在应用 sigmoid 函数之前)时对模型添加惩罚。对此你有什么想说的?
      猜你喜欢
      • 2020-04-08
      • 2017-11-12
      • 2019-09-10
      • 2012-09-23
      • 2017-05-17
      • 2020-08-14
      • 1970-01-01
      • 2015-06-11
      • 2019-10-17
      相关资源
      最近更新 更多