【发布时间】:2018-12-16 15:10:26
【问题描述】:
我在 openai-gym 看FrozenLake environments。在这两种情况下,在代理达到目标之前,都没有奖励,甚至没有负奖励。即使代理掉入冰中,也没有负面奖励——尽管这一集结束了。没有奖励,就没有什么可学的!每一集都是从零开始,没有从前几集受益。
这应该是一个简单的广度优先搜索。它不需要强化学习。但是假设您使用 RL,一种方法是,一步到冻结的正方形(这不是目标)奖励 -1,而一步进入洞的奖励 -10。 -1 将允许代理学习不重复方块。 -10 将允许代理学习避免漏洞。所以我很想在代理方面创造我自己的负面奖励。这会让它更像悬崖行者。
我错过了什么? RL 如何在没有奖励的情况下解决这个问题(通过随机搜索除外)?
【问题讨论】:
标签: openai-gym