【发布时间】:2020-09-22 07:24:38
【问题描述】:
我正在创建一个自定义环境并在上面训练一个 RL 代理。
我使用的是 stable-baselines,因为它似乎实现了所有最新的 RL 算法,并且似乎尽可能接近“即插即用”(我想专注于创建环境和奖励函数,而不是模型本身的实现细节)
我的环境有一个大小为 127 的动作空间,并将其解释为 one-hot 向量:将向量中最高值的索引作为输入值。 为了调试,我创建了一个条形图,显示每个值被“调用”了多少次
我创建了一个colab 来解释和重现该问题
我在github issue 中提出了这个问题,但他们建议我在这里发布问题
【问题讨论】:
标签: python reinforcement-learning stable-baselines