【发布时间】:2021-02-14 22:37:19
【问题描述】:
我正在学习马尔可夫决策过程。 我不知道在哪里标记终端状态。
在 4x3 网格世界中,我用 T 标记了我认为正确(我可能是错的)的终端状态。 Pic
我看到一个指令标记终端状态如下。
terminals=[(3, 2), (3, 1)]
有人能解释一下它是如何工作的吗?
【问题讨论】:
-
Artificial Intelligence Stack Exchange 可能是提出与强化学习相关的理论问题的更好地方,所以我建议你在那里提问(当然,下次你有关于 RL 的问题时,你应该在那里问)。如果你在那里问,请从这里删除(以避免交叉发布,这通常是不鼓励的)。
标签: reinforcement-learning markov markov-decision-process