【发布时间】:2017-03-06 16:36:37
【问题描述】:
我无法理解on-policy 方法(如A3C)和off-policy 方法(如DDPG)之间的根本区别是什么。据我所知,off-policy 方法可以学习最优策略,而不管行为策略如何。它可以通过观察环境中的任何轨迹来学习。因此,我可以说离策略方法比在策略方法更好吗?
我已经阅读了cliff-walking example,其中显示了SARSA 和Q-learning 之间的区别。它说Q-learning 将学习沿着悬崖行走的最优策略,而SARSA 将学习在使用epsilon-greedy 策略时选择更安全的方式。但是既然Q-learning已经告诉我们最优策略了,那我们为什么不按照那个策略继续探索呢?
另外,两种学习方法是否存在一种优于另一种的情况?在哪种情况下,人们会更喜欢 on-policy 算法?
【问题讨论】:
标签: reinforcement-learning q-learning