【发布时间】:2017-02-23 12:06:18
【问题描述】:
我应该避免将 L2 正则化与 RMSprop 和 NAG 结合使用吗?
L2 正则化项干扰梯度算法(RMSprop)?
最好的问候,
【问题讨论】:
-
有什么好的理由得出这个结论?
-
用共轭梯度训练一层 + softmax 输出更多的 L2 正则化会导致更好的预测精度,使用 RMSProp 或 NAG 更多的 L2 正则化会导致最差的预测精度。
-
这不是一个好的理由。这是一个非常广泛且非科学的陈述,有许多可能的解释(我们无法给出,因为我们对您的数据或基准设置一无所知)。你真的在使用CG吗?不是梯度下降/随机梯度下降?嗯......我只是不会像你那样得出这个结论。但是请随意尝试所有的优化器。如果您有时间,请调整 vanilla-SGD(可能包括动量)。
-
对不起,我给出进一步的解释。对于相同的测试梯度算法(共轭、adagrad、rmsprop、nesterov),在不同的赛季中以相似的准确度预测 3 个赛季的足球联赛。在没有正则化 L2 的情况下,预测准确度的最佳标记是 Nesterov,但使用正则化 L2 时,最好的标记是共轭(优于没有 L2 的共轭),同时,nesterov 或 rmsprop 的准确度比以前最差。
标签: machine-learning neural-network backpropagation