【问题标题】:RMSprop, Adam, AdaDelta test accuracy does not improve using CaffeRMSprop、Adam、AdaDelta 测试准确度未使用 Caffe 提高
【发布时间】:2015-12-30 19:55:36
【问题描述】:

我是finetuning,在Tesla K40 上的图像数据集上使用Caffe。使用batch size=47solver_type=SGDbase_lr=0.001lr_policy="step"momentum=0.9gamma=0.1training loss 减少,test accuracy100 迭代中从2%-50% 变为相当不错。

当使用RMSPROPADAMADADELTA 等其他优化器时,training loss 几乎保持不变,test accuracy1000 迭代后没有任何改进。

对于RMSPROP,我已经更改了here提到的各个参数。

对于ADAM,我已经更改了here提到的各个参数

对于ADADELTA,我已经更改了here提到的各个参数

谁能告诉我我做错了什么?

【问题讨论】:

  • 我发现应该使用与 SGD 不同的求解器的较低学习率。 Howeber,我不太清楚为什么。
  • 与 SGD 相比,您的学习率降低了多少?
  • 如果我使用与 SGD 相同的学习率,则 RMSProp 算法会发散,而它会以 1/3 的学习率收敛(acc 比我调整好的 SGD 略低)原本的。但是,它可能是非常具体的问题。
  • @VeilEclipse:你解决了你的问题吗?我也遇到了这个问题。我使用亚当/没有亚当给出相同的结果。我正在使用 base_lr 与 SGD 相同

标签: machine-learning computer-vision deep-learning caffe pycaffe


【解决方案1】:

我看到了与 pir 相似的结果:当给定 SGD 使用的相同 base_lr 时,Adam 会发散。当我将 base_lr 减小到原来的 1/100 时,Adam 突然收敛,并且给出了很好的结果。

【讨论】:

  • 感谢您的指出。这意味着如果 base_lr: 1e-3 代表 SGD,那么 base_lr: 1e-5 代表 Adam。是不是太小了?
  • 我发现 1e-4 对 Adam 来说是一个很好的学习率。您还应该在您的数据集上尝试 1e-3 和 1e-5,看看您是否获得了良好的性能
  • 就我而言,Adam 的 lr_rate 是 SGD 的两倍。我也试过 50%, 150% ,但 200% lr_rate 最适合我
猜你喜欢
  • 2023-04-02
  • 1970-01-01
  • 2017-05-03
  • 2020-11-06
  • 1970-01-01
  • 2017-10-09
  • 2019-04-25
  • 2018-10-14
  • 1970-01-01
相关资源
最近更新 更多