【发布时间】:2020-05-18 04:02:43
【问题描述】:
bellman 最优方程(sutton 2018 年第 63 页)的状态-作用最优值为
Q 学习是
我知道 Q-learning 是无模型的。所以它不需要下一个状态的转换概率。
然而,贝尔曼方程的 p(s'r|s,a) 是下一个状态 s' 在给定 s, a 时具有奖励 r 的转移概率。所以我认为要得到一个 Q(s,a),它需要转换的概率。
贝尔曼方程的Q和q-learning的Q不一样?
如果相同,q-learning 是如何作为无模型工作的?
有没有什么方法可以得到一个 Q(s,a) 而不管 q-learning 的转换概率如何?
或者我在混淆什么?
【问题讨论】:
标签: machine-learning artificial-intelligence reinforcement-learning q-learning