【问题标题】:Deep Reinforcement Learning behaviour when the next state is same as the prev_state for the same episode下一个状态与同一集的 prev_state 相同时的深度强化学习行为
【发布时间】:2020-09-20 02:44:04
【问题描述】:

我有一个问题,当我们开始一个情节时,我们处于一个从 N 个离散状态中随机选择的状态(N 是一个数字)。采取行动 A(连续行动空间)并收到奖励 R。但是,下一个状态不会改变。因此状态转换看起来像 -> (S, A, R, S)。我想知道是否有人曾经用 DDPG 尝试过这个问题(因为连续动作空间)。这甚至是 RL 问题吗?

知道如果我们尝试使用 DDPG 运行这样的问题(在采取行动时状态不会改变),会有什么行为吗?

【问题讨论】:

    标签: reinforcement-learning


    【解决方案1】:

    您的问题似乎不完整。每一步都在发生吗?或者只是其中一些你能注意到的。如果是后者,那么是的,前一个状态和下一个状态可以相似。这实际上取决于环境的配置。在 DDPG 中,根据连续动作,它很有可能保持相同的状态,具体取决于代理在环境中采取“步骤”时发生的情况。

    【讨论】:

    • 每一步都在发生。无论你采取什么行动,状态都不会改变
    • 我没有密码。这是一个概念性的问题。就像采用标准的 ddpg 问题并应用特定的约束来稍微改变问题一样。所以,我想知道它如何改变使用的算法。
    猜你喜欢
    • 1970-01-01
    • 2018-11-05
    • 2022-01-17
    • 2020-06-30
    • 2017-04-07
    • 1970-01-01
    • 1970-01-01
    • 2016-10-24
    • 2019-10-20
    相关资源
    最近更新 更多