【问题标题】:Number of Q values for a deep reinforcement learning network深度强化学习网络的 Q 值数量
【发布时间】:2018-04-23 16:30:21
【问题描述】:

我目前正在开发一个深度强化学习网络,但是,我对 NN 输出的 q 值的数量有一点疑问。我总共将有 150 个 q 值,这对我个人来说似乎过多。我已经阅读了几篇论文和书籍,这可能是一个问题。我知道这将取决于我将构建的 NN 类型,但是你们是否认为 q 值的数量太高了?我应该减少它吗?

【问题讨论】:

  • 什么是“Q值的数量”?你的意思是你有 150 个动作要采取,因此对于每个状态 s 有 150 个 Q(a, s) 需要估计?
  • 是的,就是这样

标签: neural-network deep-learning reinforcement-learning q-learning


【解决方案1】:

“太多”没有一般原则。一切都完全取决于一个人可以在学习中获得的问题和吞吐量。特别是,只要 Q(a, s) 的内部参数化是有效的,动作的数量就不一定重要。举个例子,假设神经网络实际上是 NN(a, s) = Q(a, s) 的形式,换句话说,它接受动作作为输入,连同状态,并输出Q值。如果这样的架构可以针对所考虑的问题进行训练,那么它可能能够扩展到大的行动空间;另一方面,如果神经网络基本上每个动作都有独立的输出,形式为 NN(s)[a] = Q(a, s),那么许多动作会导致模型的学习信号相对稀疏,从而导致缓慢收敛。

由于您询问的是减少动作空间,听起来真正的问题具有复杂的控制(也许它是一个连续的控制域?)并且您正在寻找一些离散化以使其更易于学习.如果是这种情况,您将不得不遵循典型的反复试验方法 - 尝试使用简单的动作空间,观察动态,如果结果不令人满意 - 增加问题的复杂性。这允许进行迭代改进,而不是朝相反的方向前进 - 从太复杂的设置开始而无法获得任何结果,而不是在不知道什么是“合理值”的情况下减少它。

【讨论】:

    猜你喜欢
    • 2018-09-25
    • 2023-02-01
    • 2018-11-05
    • 2020-06-30
    • 2020-11-24
    • 1970-01-01
    • 2020-07-12
    • 2022-01-17
    • 1970-01-01
    相关资源
    最近更新 更多