【发布时间】:2015-12-30 19:55:36
【问题描述】:
我是finetuning,在Tesla K40 上的图像数据集上使用Caffe。使用batch size=47、solver_type=SGD、base_lr=0.001、lr_policy="step"、momentum=0.9、gamma=0.1,training loss 减少,test accuracy 在100 迭代中从2%-50% 变为相当不错。
当使用RMSPROP、ADAM 和ADADELTA 等其他优化器时,training loss 几乎保持不变,test accuracy 在1000 迭代后没有任何改进。
对于RMSPROP,我已经更改了here提到的各个参数。
对于ADAM,我已经更改了here提到的各个参数
对于ADADELTA,我已经更改了here提到的各个参数
谁能告诉我我做错了什么?
【问题讨论】:
-
我发现应该使用与 SGD 不同的求解器的较低学习率。 Howeber,我不太清楚为什么。
-
与 SGD 相比,您的学习率降低了多少?
-
如果我使用与 SGD 相同的学习率,则 RMSProp 算法会发散,而它会以 1/3 的学习率收敛(acc 比我调整好的 SGD 略低)原本的。但是,它可能是非常具体的问题。
-
@VeilEclipse:你解决了你的问题吗?我也遇到了这个问题。我使用亚当/没有亚当给出相同的结果。我正在使用
base_lr与 SGD 相同
标签: machine-learning computer-vision deep-learning caffe pycaffe