【问题标题】:State value and state action values with policy - Bellman equation with policy带有策略的状态值和状态动作值 - 带有策略的贝尔曼方程
【发布时间】:2018-08-02 15:36:47
【问题描述】:

我刚刚开始使用深度强化学习,我正在努力克服这个概念。

我有这个确定性贝尔曼方程

当我从 MDP 实现随机性时,我得到 2.6a

我的等式是这个假设正确的。我看到这个实现 2.6a 在状态值函数上没有策略标志。但对我来说,这没有任何意义,因为我正在使用我可能最终进入哪些不同的下一步的概率。我认为这与说政策相同。如果是 2.6a 是正确的,那么我可以假设其余部分(2.6b 和 2.6c),因为那时我想像这样编写动作状态函数:

我之所以这样做,是因为我想从确定性的角度来解释自己。

我希望有人可以帮助解决这个问题!

最好的问候索伦科赫

【问题讨论】:

    标签: equation policy reinforcement-learning mdp markov-decision-process


    【解决方案1】:

    是的,你的假设是完全正确的。在强化学习领域,价值函数是从特定状态开始并遵循策略 π 获得的回报。所以是的,严格来说,它应该伴随着策略符号 π 。

    贝尔曼方程基本上递归地表示值函数。不过需要注意的是,有两种贝尔曼方程:

    • Bellman 最优性方程,表征最优值函数。在这种情况下,它的价值函数隐含地与最优策略相关联。该等式具有非线性maxoperator,并且是您发布的那个。 (最佳)策略依赖有时用星号表示,如下所示: 也许一些简短的文本或论文会忽略这种依赖关系,假设它是显而易见的,但我认为任何 RL 教科书最初都应该包含它。例如,参见Sutton & BartoBusoniu et al。书。

    • 贝尔曼方程,它表征了一个价值函数,在这种情况下与任何策略 π 相关联:

    在您的情况下,您的方程 2.6 基于贝尔曼方程,因此它应该删除 max 运算符并包括所有动作和可能的下一个状态的总和。来自Sutton & Barto(抱歉,您的问题的符号改变了,但我认为它不够稳定):

    【讨论】:

    • 我已经更新了答案以添加额外的解释。我想现在我的观点更清楚了。感谢您的评论!
    • 我仍然不同意“在你的情况下,你的方程 2.6 基于贝尔曼方程,因此它应该删除 max 运算符并包括所有动作和可能的下一个状态的总和”。他从(给定的)最优价值函数开始(通常我们假设如果没有上标/下标也是如此)。然后他尝试为不确定的情况重写它。这并不意味着他应该突然离开最优价值函数。
    • 对,他应该决定是使用价值函数还是最优价值函数。但我认为回应指出了 OP 的误解和可能的正确方向。如果用户提供一些反馈,也许我可以更新响应。无论如何,再次感谢建设性的 cmets Dennis :)
    【解决方案2】:

    不,价值函数V(s_t) 不依赖于策略。您在等式中看到它是根据使数量最大化的操作a_t 定义的,因此它不是根据任何策略选择的操作来定义的。

    在非确定性/随机情况下,您将得到概率总和乘以状态值,但这仍然独立于任何策略。总和仅对不同的可能未来状态求和,但每次乘法都涉及完全相同的(与策略无关的)动作a_t。您拥有这些概率的唯一原因是,在不确定的情况下,特定状态下的特定操作可能导致多种不同可能状态中的一种。这不是由于政策,而是由于环境本身的随机性。


    确实存在诸如策略的价值函数之类的东西,并且在谈论应该包括策略的符号时。但这通常不是“价值函数”的含义,而且与您向我们展示的方程式不匹配。一个依赖于策略的函数会将max_{a_t} 替换为所有动作的总和a,并在总和中表示策略pi 在状态s_t 中选择动作a 的概率pi(s_t, a)

    【讨论】:

      猜你喜欢
      • 2019-01-29
      • 2012-02-25
      • 1970-01-01
      • 2018-07-03
      • 1970-01-01
      • 1970-01-01
      • 2021-11-12
      • 2021-07-03
      • 1970-01-01
      相关资源
      最近更新 更多