【问题标题】:How to interpret "Value Loss" chart in TensorBoard?如何解释 TensorBoard 中的“价值损失”图表?
【发布时间】:2020-05-19 09:51:07
【问题描述】:

我在 Unity 机器学习代理中有一个目标发现、避障直升机。查看用于训练的 TensorBoard,我试图了解如何解释“损失/价值损失”。

我在谷歌上搜索了许多关于 ML Loss 的文章,例如 this one,但我似乎无法直观地理解这对我的小直升机意味着什么以及我应该实施的可能改变(如果有的话)。 (直升飞机以接近目标为奖励,以更远或碰撞为惩罚。它测量相对速度,相对目标位置,射线传感器等各种东西,它基本上是在目标中工作的- 寻找,而更复杂的迷宫类型障碍尚未经过测试或训练。它使用 3 层。)谢谢!

【问题讨论】:

    标签: tensorflow unity3d machine-learning tensorboard


    【解决方案1】:

    在强化学习中,特别是关于演员/批评者算法,价值损失是学习算法对状态价值的期望之间的差异(或许多此类差异的平均值) > 以及该状态的经验观察值

    一个州的价值是什么?简而言之,一个州的价值就是在您从该州开始的情况下,您可以期望获得多少回报。即时奖励完全贡献了这一数额。可能发生但不会立即发生的奖励越来越少,更远的事件的贡献越来越少。我们将这种对价值贡献的减少称为“折扣”,或者我们说这些奖励是“折扣的”。

    预期值是算法的批评部分预测值的多少。在以神经网络实现的批评者的情况下,它是以状态作为输入的神经网络的输出。

    经验观察值是当您将离开该状态时实际获得的奖励相加时获得的金额,再加上您在此之后立即获得的任何奖励(折扣一定数量)步骤数(我们会在这些步骤之后说您最终进入状态 X),以及(可能取决于实施)加上基于状态 X 值的一些折扣金额。

    简而言之,它越小,就越能更好地预测其性能。这并不意味着它会变得更好——毕竟,一个人在游戏中可能很糟糕,但如果他们学会选择会让他们快速输掉的动作,他们可以准确地预测他们会输以及什么时候输!

    【讨论】:

    • 谢谢,这是一个非常有用的解释!如果我当时将价值损失视为“奖励错误预测金额(特别是短期)”,是否非常合适?我也想知道价值损失的哪些关键方面使它不会最终与累积奖励图表成反比,但也许简单的答案是它只是不直接相关,因为它衡量的是非常不同的事情.编辑:你新的最后一段回答了我在这里的最后一个问题。谢谢!
    • @PhilippLenssen 是的,我认为这是一个公平的描述。我在答案中添加了一些内容,希望能回答此评论的第二部分
    猜你喜欢
    • 2019-05-13
    • 2018-02-01
    • 2018-12-01
    • 1970-01-01
    • 2020-06-27
    • 1970-01-01
    • 2018-08-12
    • 1970-01-01
    • 2017-12-31
    相关资源
    最近更新 更多