【发布时间】:2023-03-05 18:04:01
【问题描述】:
我有一个关于this SARSA FA 的问题。
在输入单元格 142 中,我看到了这个修改后的更新
w += alpha * (reward - discount * q_hat_next) * q_hat_grad
其中q_hat_next 是Q(S', a'),q_hat_grad 是Q(S, a) 的导数(假设S, a, R, S' a' 序列)。
我的问题是更新不应该是这样的吗?
w += alpha * (reward + discount * q_hat_next - q_hat) * q_hat_grad
修改后的更新背后的直觉是什么?
【问题讨论】:
标签: machine-learning reinforcement-learning openai-gym sarsa