【发布时间】:2016-05-16 07:21:59
【问题描述】:
在 Andrew Ng 的讲义中,他们使用 LBFGS 并获得了一些隐藏的功能。我可以改用梯度下降并产生相同的隐藏特征吗?其他参数都一样,只是改变优化算法。
因为当我使用 LBFGS 时,我的自动编码器可以产生与讲义中相同的隐藏特征,但是当我使用梯度下降时,隐藏层中的特征消失了,看起来完全随机。
具体来说,为了优化成本函数,我实现了 1)成本函数,2)每个权重和偏差的梯度。并将它们放入 scipy 优化工具箱中以优化成本函数。而且这个设置可以给我合理的隐藏功能。
但是当我改为梯度下降时。我试图让“Weight - Gradient of the Weight”和“Bias - Gradient of the Bias”。但生成的隐藏特征看起来完全是随机的。
有人可以帮我知道原因吗?谢谢。
【问题讨论】:
-
they use LBFGS and get some hidden features. Can I use gradient descent instead and produce the same hidden features?- 原则上是的。至少如果两者都收敛。然而,对于某些函数,梯度下降可能会非常缓慢,因此您可能无法在合理的时间内达到局部最优。如果您想自己实现优化,步长的选择也很重要。
标签: machine-learning mathematical-optimization deep-learning gradient-descent autoencoder