【发布时间】:2018-12-08 06:03:55
【问题描述】:
我目前能够使用 Q-Learning 训练一个系统。我将把它移到 Actor_Critic (A2C) 方法。请不要问我为什么要这样做,我必须这样做。
我目前正在从https://github.com/higgsfield/RL-Adventure-2/blob/master/1.actor-critic.ipynb借用实现
问题是,我不断获得大约 50% 的成功率(这基本上是随机行为)。我的游戏很长(50 步)。我应该打印出奖励、价值还是什么?我应该如何调试这个?
这里有一些日志:
simulation episode 2: Success, turn_count =20
loss = tensor(1763.7875)
simulation episode 3: Fail, turn_count= 42
loss = tensor(44.6923)
simulation episode 4: Fail, turn_count= 42
loss = tensor(173.5872)
simulation episode 5: Fail, turn_count= 42
loss = tensor(4034.0889)
simulation episode 6: Fail, turn_count= 42
loss = tensor(132.7567)
loss = simulation episode 7: Success, turn_count =22
loss = tensor(2099.5344)
作为一个总体趋势,我观察到,对于 Success 情节,损失往往很大,而对于 Fail 情节,损失函数输出往往很小。
【问题讨论】:
标签: tensorflow machine-learning artificial-intelligence pytorch reinforcement-learning