【发布时间】:2018-09-14 15:05:46
【问题描述】:
我想为使用鼠标移动的游戏实施强化学习。这个游戏只关心鼠标的x轴。
我的第一个尝试是使其离散。游戏将有 3 个动作。两个动作用于将鼠标左右移动 30 像素,一个动作用于静止不动。它有效,但现在我想让它连续。
我所做的是使神经网络输出均值和标准。就像这个代码https://github.com/stefanbo92/A3C-Continuous/blob/master/a3c.py。我什至在第二次尝试时使用了此代码。游戏的宽度是 480,所以 A_BOUND 是 [-240,240]。为了使问题始终具有积极的作用,我将预测的作用添加到 240,然后将鼠标位置设置为新的。
例如:如果动作是 240 + -240,那么鼠标 x pos 将为 0。问题是我的神经网络在开始后几秒内始终输出 240 到 -240 的极值。
【问题讨论】:
-
你的学习率有多大?
-
我的学习率是0.0001
-
减少会不会好些?
-
我尝试了前一个的 1/5,并调整了权重和偏差。现在极端情况不会发生,但我的演员喜欢积极,所以我的意思总是积极的。这可能是因为正面有更多的回报,但它应该尝试同时获得两者的回报,并且在必要时总是积极和消极。唯一一次变为负数是在开始时,然后永远不会回头。我不知道为什么。 – dark1sider 7 分钟前
-
请edit标题中的错字,谢谢。
标签: tensorflow deep-learning reinforcement-learning