【问题标题】:How is the equation in “Evolution Strategies as a Scalable Alternative to Reinforcement Learning” derived?“进化策略作为强化学习的可扩展替代方案”中的方程式是如何得出的?
【发布时间】:2018-05-25 04:38:59
【问题描述】:

在 OpenAI 论文“Evolution Strategies as a Scalable Alternative to Reinforcement Learning”中,第 3 页中的等式是如何推导出来的?

【问题讨论】:

  • @werediver 刚刚弄清楚如何接受答案。

标签: machine-learning reinforcement-learning evolutionary-algorithm


【解决方案1】:

它不是“派生的”,因为这个方程不是从论文中提出的前一个方程自然发展而来的。

这个公式演示了作者如何选择应用随机梯度上升。这是他们使用的算法的数学表示。

在该等式的正下方,他们解释了它的工作原理:

生成的算法重复执行两个阶段:1) 随机扰动策略的参数并评估 通过在环境中运行一个情节得到的参数,以及 2)结合这些情节的结果,计算随机 梯度估计,并更新参数。

从头开始重新开始论文并非常缓慢而仔细地阅读可能会有所帮助。如果您遇到任何没有意义的内容,请查一下,在您理解作者试图告诉您的内容之前不要继续阅读论文。

【讨论】:

  • 谢谢。我发现这个答案看起来更清楚stats.stackexchange.com/questions/348111/…
  • @leonexu 事实上,在这个特定的网站上,很难对处理方程式的问题做出任何有效的回答,因为 Stack Overflow 不支持 LaTeX(但某些堆栈交换网站支持)
猜你喜欢
  • 2019-04-17
  • 2018-02-25
  • 1970-01-01
  • 2012-09-06
  • 2014-01-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-02-26
相关资源
最近更新 更多