【问题标题】:Can not understand this line of a popular deep Q learning program看不懂这行流行的深度Q学习程序
【发布时间】:2017-04-21 16:23:00
【问题描述】:

https://github.com/yenchenlin/DeepLearningFlappyBird/blob/master/deep_q_network.py#L82

我花了很多时间来理解它。

为什么使用tf.multiply

我找不到支持这种乘法运算的数学。

【问题讨论】:

标签: machine-learning deep-learning reinforcement-learning


【解决方案1】:

每个动作都有一个 Q_value。

并且动作输入a是one-hot。

所以这一行是选择“热”Q_v​​alue。

【讨论】:

    猜你喜欢
    • 2018-09-25
    • 1970-01-01
    • 2021-08-18
    • 1970-01-01
    • 2017-04-24
    • 1970-01-01
    • 2021-01-20
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多