【发布时间】:2021-01-16 04:20:20
【问题描述】:
双QN背后的想法是什么?
用于计算 Q 值以更新在线网络的贝尔曼方程遵循以下等式:
value = reward + discount_factor * target_network.predict(next_state)[argmax(online_network.predict(next_state))]
原始DQN中用于计算Q值更新的贝尔曼方程为:
value = reward + discount_factor * max(target_network.predict(next_state))
但是用于评估动作的目标网络是使用权重更新的 online_network 的值和馈送到目标值的基本都是旧的 q 值的动作。
任何想法如何根据第一个网络的权重添加另一个网络有帮助?
【问题讨论】:
-
Artificial Intelligence Stack Exchange 可能是提出与强化学习相关的理论问题的更好地方,所以我建议你在那里问你的问题(尽管我认为那里已经被问过了)。如果你在那里问,请从这里删除(以避免交叉发布,这通常是不鼓励的)。
标签: double reinforcement-learning dqn