【问题标题】:Gym (openAI) environment actions space depends from actual stateGym (openAI) 环境动作空间取决于实际状态
【发布时间】:2018-10-24 13:59:49
【问题描述】:

我正在使用gym 工具包创建自己的环境,并使用keras-rl 在代理中使用我的环境。 问题是我的动作空间发生了变化,这取决于实际状态。 例如,我有 46 个可能的动作,但给定某个状态,只有 7 个可用,我无法找到对其建模的方法。

我读过这个问题open-ai-enviroment-with-changing-action-space-after-each-step

但这并没有解决我的问题。

在 Gym 文档中没有执行此操作的说明,只有他们的 Github repo 上的一个问题(仍然开放)。 我不明白代理(keras-rl,dqn 代理)如何采取行动,是随机选择的吗?但从哪里来?

有人可以帮助我吗?想法?

【问题讨论】:

    标签: reinforcement-learning openai-gym keras-rl


    【解决方案1】:

    我通过忽略任何无效操作并让探索机制防止它卡住来处理这个问题。快速简单,但可能是更好的方法。

    我认为更好的选择是以某种方式将选择该操作的概率设置为零,但我无法弄清楚如何做到这一点。

    【讨论】:

      猜你喜欢
      • 2022-08-03
      • 1970-01-01
      • 2019-06-04
      • 1970-01-01
      • 2021-11-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多