【问题标题】:Intuition behind policy iteration on a grid world网格世界策略迭代背后的直觉
【发布时间】:2012-10-29 00:20:30
【问题描述】:

我应该想出一个 MDP 代理,它使用策略迭代和值迭代进行分配,并将其性能与状态的效用值进行比较。

鉴于 MDP 代理知道转移概率和奖励,它如何知道要移动哪个动作?

据我了解,MDP 代理将执行策略迭代,并在给定策略的情况下计算它在达到终止状态时获得的奖励。该策略是从值迭代算法发展而来的。

有人可以提供一些关于策略迭代如何工作的直觉吗?

【问题讨论】:

标签: artificial-intelligence reinforcement-learning markov


【解决方案1】:

假设您已经了解策略迭代和值迭代算法是什么,代理只需通过为每个状态选择具有最高值的操作来构建新策略。

一个动作的价值是该动作在所有可能的下一个状态中到达下一个状态的概率*(下一个状态的值 + 转换的奖励)的总和。

【讨论】:

    猜你喜欢
    • 2019-05-07
    • 1970-01-01
    • 2018-07-28
    • 1970-01-01
    • 1970-01-01
    • 2017-09-29
    • 2016-07-06
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多