【发布时间】:2018-06-21 08:39:20
【问题描述】:
我在 keras 中构建了一个 A3C 实现,并以此为参考:https://jaromiru.com/2017/03/26/lets-make-an-a3c-implementation/ 而且我正在使用自定义环境,代理可以选择购买一些物品,出售或交换它们的价格作为状态。对好的交易给予正面奖励,对坏交易给予负面奖励。我过去曾在 DQN 上对其进行过测试,它成功收敛,显示出非常好的结果。但是当我在 A3C 中使用相同的环境时,它会导致模型一遍又一遍地选择相同的动作。我尝试更改一些超参数,但没有结果。我还尝试使用目标模型并每 n 集更新一次,这可以更好地与健身房 CartPole 环境融合,但仍然没有影响我的模型在我的自定义环境中的性能。我在reddit上发现了一些关于同样问题的讨论,但没有一个得到回答。
【问题讨论】:
-
抱歉,这不是编程问题。 RL 算法的收敛性是出了名的不稳定,你对一个参数做一个小的改动,整个事情就会崩溃。
-
@MatiasValdenegro 你能建议我在哪里提问以获得更详细的答案吗?
标签: python-3.x tensorflow keras reinforcement-learning