【问题标题】:What is terminal state in gridworld?网格世界中的终端状态是什么?
【发布时间】:2021-02-14 22:37:19
【问题描述】:

我正在学习马尔可夫决策过程。 我不知道在哪里标记终端状态。

在 4x3 网格世界中,我用 T 标记了我认为正确(我可能是错的)的终端状态。 Pic

我看到一个指令标记终端状态如下。

terminals=[(3, 2), (3, 1)]

有人能解释一下它是如何工作的吗?

【问题讨论】:

  • Artificial Intelligence Stack Exchange 可能是提出与强化学习相关的理论问题的更好地方,所以我建议你在那里提问(当然,下次你有关于 RL 的问题时,你应该在那里问)。如果你在那里问,请从这里删除(以避免交叉发布,这通常是不鼓励的)。

标签: reinforcement-learning markov markov-decision-process


【解决方案1】:

在给定的网格世界中,您从 (0,0) 的“开始”开始。然后你从那个点开始移动。如果您到达“end +1”{(3,2)},则奖励为 +1,游戏结束。同样,如果您到达“end -1”{(3,1)},则奖励为 -1,游戏结束。然而,当你四处移动时,你不能移动到 {(1,1)} 作为它的无效状态。此外,如果您达到任何处于 {(2,0) 和 (2,1)} 的终端状态“T”,那么游戏将以零奖励结束。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2020-05-19
    • 2011-01-27
    • 2019-06-26
    • 1970-01-01
    • 1970-01-01
    • 2021-05-18
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多