【问题标题】:Why Gt+1 = v(St+1) in Bellman Equation for MRPs?为什么在 MRP 的贝尔曼方程中 Gt+1 = v(St+1)?
【发布时间】:2021-11-30 15:02:23
【问题描述】:

在 David Silver 第 19 页的 中,它具有以下派生公式:

我发现 等于 这意味着 Gt+1 = v(St+1) 所以 Gt = v(St)

根据返回定义:

并根据Gt = v(St):

v(St) = Gt =

但是价值函数的定义是

这意味着 v(s) = = 这是绝对错误的。

我的问题是

  1. 为什么 Gt+1 = v(St+1)?
  2. 我的推导错误在哪里?

【问题讨论】:

    标签: reinforcement-learning markov-chains markov


    【解决方案1】:

    第一个大错误是声称E[a + b] = E[a + c] 实现了b=c,这不是预期的工作方式。特别是E[a + b] = E[a] + E[b]E[a] = E[a] + E[c],因此我们有E[b] = E[c](而不是b=c!)所以G_{t+1} 不等于v(S_{t+1}),而是E[G_{t+1}] = v(S_{t+1})(来自定义)。

    一般函数值相等并不会使参数相等。同样,f(x + a) = f(x + b) 并不意味着 a=b 表示 f(x) = x^2,因为它也适用于 x=0、a=-1、b=1。

    【讨论】:

      猜你喜欢
      • 2022-08-13
      • 2020-08-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-05-18
      • 2021-09-27
      • 1970-01-01
      相关资源
      最近更新 更多