【发布时间】:2020-09-20 02:44:04
【问题描述】:
我有一个问题,当我们开始一个情节时,我们处于一个从 N 个离散状态中随机选择的状态(N 是一个数字)。采取行动 A(连续行动空间)并收到奖励 R。但是,下一个状态不会改变。因此状态转换看起来像 -> (S, A, R, S)。我想知道是否有人曾经用 DDPG 尝试过这个问题(因为连续动作空间)。这甚至是 RL 问题吗?
知道如果我们尝试使用 DDPG 运行这样的问题(在采取行动时状态不会改变),会有什么行为吗?
【问题讨论】: