【问题标题】:Should I avoid to use L2 regularization in conjuntion with RMSProp?我应该避免将 L2 正则化与 RMSProp 结合使用吗?
【发布时间】:2017-02-23 12:06:18
【问题描述】:

我应该避免将 L2 正则化与 RMSprop 和 NAG 结合使用吗?

L2 正则化项干扰梯度算法(RMSprop)?

最好的问候,

【问题讨论】:

  • 有什么好的理由得出这个结论?
  • 用共轭梯度训练一层 + softmax 输出更多的 L2 正则化会导致更好的预测精度,使用 RMSProp 或 NAG 更多的 L2 正则化会导致最差的预测精度。
  • 这不是一个好的理由。这是一个非常广泛且非科学的陈述,有许多可能的解释(我们无法给出,因为我们对您的数据或基准设置一无所知)。你真的在使用CG吗?不是梯度下降/随机梯度下降?嗯......我只是不会像你那样得出这个结论。但是请随意尝试所有的优化器。如果您有时间,请调整 vanilla-SGD(可能包括动量)。
  • 对不起,我给出进一步的解释。对于相同的测试梯度算法(共轭、adagrad、rmsprop、nesterov),在不同的赛季中以相似的准确度预测 3 个赛季的足球联赛。在没有正则化 L2 的情况下,预测准确度的最佳标记是 Nesterov,但使用正则化 L2 时,最好的标记是共轭(优于没有 L2 的共轭),同时,nesterov 或 rmsprop 的准确度比以前最差。

标签: machine-learning neural-network backpropagation


【解决方案1】:

好像有人把问题(2018)整理出来了(2017)。

普通自适应梯度(RMSProp、Adagrad、Adam 等)与 L2 正则化不匹配。

链接到论文 [https://arxiv.org/pdf/1711.05101.pdf] 和一些介绍:

在本文中,我们展示了一个 最流行的泛化能力差的主要因素 自适应梯度方法,Adam,是由于 L2 正则化对它的效果不如对 SGD 有效。

L2 正则化和权重衰减并不相同。 与普遍看法相反,这两种技术并非 相等的。对于 SGD,它们可以等价于 基于权重衰减因子的重新参数化 关于学习率;这不是亚当的情况。 在 特别是,当与自适应梯度结合时,L2 正则化导致具有大梯度的权重 正则化的程度低于使用时的程度 重量衰减。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2012-10-14
    • 2010-09-23
    • 2018-06-16
    • 2011-12-31
    • 2021-06-03
    • 2011-03-26
    • 2016-02-28
    • 1970-01-01
    相关资源
    最近更新 更多