【问题标题】:QLearning and never-ending episodesQLearning 和永无止境的情节
【发布时间】:2023-04-10 06:49:01
【问题描述】:

假设我们有一个机器人可以移动的 (x,y) 平面。现在我们将世界的中间定义为目标状态,这意味着一旦我们的机器人达到该状态,我们将给它 100 的奖励。

现在,假设有 4 个状态(我称之为 A、B、C、D)可以导致目标状态。

当我们第一次处于 A 并进入目标状态时,我们将更新我们的 QValues 表如下:

Q(state = A, action = going to goal state) = 100 + 0

可能会发生两种情况之一。我可以在这里结束这一集,然后开始一个不同的集,机器人必须再次找到目标状态,或者即使我找到了目标状态,我也可以继续探索世界。如果我尝试这样做,我会看到一个问题。如果我处于目标状态并回到状态 A,它的 Qvalue 将如下:

Q(state = goalState, action = going to A) = 0 + gamma * 100

现在,如果我再次尝试从 A 进入目标状态:

Q(state = A, action = going to goal state) = 100 + gamma * (gamma * 100)

这意味着如果我继续这样做,因为 0

这是 QLearning 的预期行为吗?难道我做错了什么?如果这是预期的行为,这不会导致问题吗?我知道从概率上讲,所有 4 个状态(A、B、C 和 D)都会以相同的速度增长,但即便如此,让它们永远增长还是有点让我烦恼。

即使在找到目标后仍允许代理继续探索的想法与他离目标状态越近,它越有可能处于当前可以更新的状态有关。

【问题讨论】:

  • 我真的什么都不知道,但是一旦收集到奖励就从板上移除不是有意义吗?
  • 你的想法似乎不错,但我从未在任何地方看到过。

标签: artificial-intelligence reinforcement-learning


【解决方案1】:

这与预期一致,因为 Q 估计值不是预期的reward,而是预期的return,它是(可能通过 gamma 折现的)奖励量如果我从那里开始并遵循我的政策直到剧集结束或永远,我希望从那个状态/行动中获益。

如果你给我一些按钮,并且其中一个按钮在按下时总是产生 1 美元,那么按下该按钮的真正预期回报是 1 美元。但是按下按钮的真正预期回报是无限美元,假设我有无数次按下按钮的机会。

【讨论】:

  • 我不太明白你的意思。我很清楚 Q 估计不是预期的奖励,但我不明白如果我整整一周都没有这样做,我会发现目标状态附近的状态有接近 9M 的 Qvalues 有什么意义或者别的什么,而不是在目标状态下有一种梯度为 100 并且随着我离它越来越远而越来越低。
  • 不管它从什么状态开始,它都可以在几个步骤中到达目标状态,之后它可以简单地随时修改目标状态。因此,几乎任何状态/动作对的预期回报都将趋于无穷大(或由您的 gamma 值决定的上限)。如果您想从一项持续的任务中获得有意义的 Q 值,那么您需要设计有意义的奖励。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2020-09-24
  • 1970-01-01
  • 2016-03-20
相关资源
最近更新 更多