【问题标题】:Relationship between bellman optimal equation and Q-learning贝尔曼最优方程与Q-learning的关系
【发布时间】:2020-05-18 04:02:43
【问题描述】:

bellman 最优方程(sutton 2018 年第 63 页)的状态-作用最优值为

Q 学习是

我知道 Q-learning 是无模型的。所以它不需要下一个状态的转换概率。

然而,贝尔曼方程的 p(s'r|s,a) 是下一个状态 s' 在给定 s, a 时具有奖励 r 的转移概率。所以我认为要得到一个 Q(s,a),它需要转换的概率。

贝尔曼方程的Q和q-learning的Q不一样?

如果相同,q-learning 是如何作为无模型工作的?

有没有什么方法可以得到一个 Q(s,a) 而不管 q-learning 的转换概率如何?

或者我在混淆什么?

【问题讨论】:

    标签: machine-learning artificial-intelligence reinforcement-learning q-learning


    【解决方案1】:

    Q-learning 是应用于状态-动作价值函数的贝尔曼方程的一个实例。它是“无模型”的,因为您不需要一个转换函数来确定给定决策下一个状态。

    但是,Q-Learning 有几种公式,它们在已知信息方面有所不同。特别是,当您知道转移函数时,您可以而且应该在贝尔曼方程中使用它。这导致了您引用的方程式。

    另一方面,如果您不知道转换函数,Q-learning 也可以,但您必须通过模拟来采样转换函数的影响。

    【讨论】:

      猜你喜欢
      • 2020-08-05
      • 1970-01-01
      • 1970-01-01
      • 2018-11-07
      • 1970-01-01
      • 2019-02-13
      • 2014-09-27
      • 2018-05-16
      • 1970-01-01
      相关资源
      最近更新 更多