【发布时间】:2018-10-24 13:59:49
【问题描述】:
我正在使用gym 工具包创建自己的环境,并使用keras-rl 在代理中使用我的环境。 问题是我的动作空间发生了变化,这取决于实际状态。 例如,我有 46 个可能的动作,但给定某个状态,只有 7 个可用,我无法找到对其建模的方法。
我读过这个问题open-ai-enviroment-with-changing-action-space-after-each-step
但这并没有解决我的问题。
在 Gym 文档中没有执行此操作的说明,只有他们的 Github repo 上的一个问题(仍然开放)。 我不明白代理(keras-rl,dqn 代理)如何采取行动,是随机选择的吗?但从哪里来?
有人可以帮助我吗?想法?
【问题讨论】:
标签: reinforcement-learning openai-gym keras-rl