【问题标题】:How can the FrozenLake OpenAI-Gym environment be solved with no intermediate rewards?如何在没有中间奖励的情况下解决 FrozenLake OpenAI-Gym 环境?
【发布时间】:2018-12-16 15:10:26
【问题描述】:

我在 openai-gym 看FrozenLake environments。在这两种情况下,在代理达到目标之前,都没有奖励,甚至没有负奖励。即使代理掉入冰中,也没有负面奖励——尽管这一集结束了。没有奖励,就没有什么可学的!每一集都是从零开始,没有从前几集受益。

这应该是一个简单的广度优先搜索。它不需要强化学习。但是假设您使用 RL,一种方法是,一步到冻结的正方形(这不是目标)奖励 -1,而一步进入洞的奖励 -10。 -1 将允许代理学习不重复方块。 -10 将允许代理学习避免漏洞。所以我很想在代理方面创造我自己的负面奖励。这会让它更像悬崖行者。

我错过了什么? RL 如何在没有奖励的情况下解决这个问题(通过随机搜索除外)?

【问题讨论】:

    标签: openai-gym


    【解决方案1】:

    您所描述的问题通常以Reward Shaping 来回答。

    像冰湖环境或Montazuma's Revenge,有些问题的奖励非常稀少。这意味着任何 RL 代理都必须花费很长时间来探索环境才能看到这些奖励。对于为代理设计任务的人来说,这可能非常令人沮丧。因此,就像在结冰的湖泊环境中一样,人们经常会像您建议的那样添加额外的信息。这使得奖励函数更加密集,并且(有时)允许更快的学习(如果修改后的奖励函数实际上遵循人类希望代理做的事情)。

    为了让智能体比随机搜索更快地解决这类问题,并且无需人工干预,例如奖励塑造或给智能体一个专家玩游戏的视频,智能体需要一些机制来探索空间智能方式[citation needed].

    目前关于该主题的一些研究领域是Intrinsic MotivationCuriosityOptionsOption discovery

    虽然前景看好,但这些研究领域仍处于起步阶段,有时说起来更容易:

    if agent_is_in_a_hole:
      return -10
    

    【讨论】:

    • 一个可以做到,但这似乎是作弊。我们希望代理自己发现解决方案。我们给予的帮助越多,成就的意义就越小。
    • 我完全同意。
    【解决方案2】:

    我认为这种环境的目标是找到平衡探索与利用的方法。我认为奖励操纵既不是必需的,也不是可取的。 现在,如果您尝试在 8x8 环境的 q-learning 中运行它,您可能会发现它不会收敛。 JKCooper 在 openAI 论坛上对此进行了修复。您可以查看此页面并一直滚动到底部以查看评论,https://gym.openai.com/evaluations/eval_xSOlwrBsQDqUW7y6lJOevQ

    在那里,他引入了平均终期奖励的概念。然后使用此奖励来校准/调整探索。 一开始,平均终端奖励是未定义的或为空的。在第一次“完成”迭代时,该变量会更新为该奖励的值。 在随后的每次迭代中,如果当前奖励大于平均终端奖励的现有值,则 epsilon 值“衰减”,即不鼓励探索,逐渐鼓励开发。

    使用这种技术,您可以看到 qlearning 收敛。

    openAI 上的修改版本在这里:v0.0.2

    https://gym.openai.com/evaluations/eval_FVrk7LAVS3zNHzzvissRQ/

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-06-04
      • 2019-09-21
      • 2021-11-25
      • 1970-01-01
      • 1970-01-01
      • 2022-06-21
      • 2020-10-18
      • 1970-01-01
      相关资源
      最近更新 更多