【问题标题】:Encoding invariance for deep neural network深度神经网络的编码不变性
【发布时间】:2016-04-28 10:26:46
【问题描述】:

我有一组数据,二维矩阵(如灰色图片)。 并使用 CNN 进行分类。 想知道是否有任何关于准确性影响的研究/经验 如果我们改变传统编码的编码。

我想是的,问题是编码的哪种转换使准确性不变,哪一种会恶化......

澄清一下,这主要涉及将原始数据量化为输入数据的过程。

编辑:

将原始数据量化为输入数据已经是对数据的预处理,添加或删除一些特征(甚至是次要特征)。这个量化过程对真实 dnn 计算的准确度影响似乎不是很清楚。 也许,可以进行一些研究。

【问题讨论】:

  • 编码是什么意思,传统的编码是什么?
  • 当你在DNN中输入日期时,你需要将原始数据编码成张量......传统的是1toK或RGB颜色值......
  • 如果您的意思是分类方面的 1 到 K,或者一种热编码,这些东西不会影响准确性。我不确定您所说的 RGB 颜色值是什么意思,这不是编码。
  • RGB 值是一种编码,因为张量的每一层的值都在 0..255 之间。编码还意味着数据的表示,即输入的原始数据的量化。它有影响(量化过程)。
  • RGB可以是任何东西,不一定是[0, 255],你可以输入[0, 1]范围内的RGB图像,无需任何量化。但是 RGB 如何应用于您的数据?

标签: tensorflow deep-learning conv-neural-network keras


【解决方案1】:

我不知道有任何专门处理输入数据量化的研究,但您可能想查看一些有关 CNN 参数量化的相关工作:http://arxiv.org/pdf/1512.06473v2.pdf。根据您的最终目标,“Q-CNN”方法可能对您有用。

我自己对 CNN 的输入数据使用各种量化的经验是,量化程度与模型本身之间存在严重依赖关系。例如,我尝试过使用各种插值方法来减小图像大小和调色板大小,最后,我发现每种变体都需要对超参数进行不同的调整才能达到最佳效果。一般来说,我发现对数据进行轻微量化的影响可以忽略不计,但是曲线中有一个拐点,丢弃额外的信息会极大地影响可实现的准确性。不幸的是,我不知道有什么方法可以在没有实验的情况下确定什么程度的量化是最佳的,甚至决定什么是最佳的也涉及效率和准确性之间的权衡,这不一定是一刀切回答。

从理论上讲,请记住 CNN 需要能够找到有用的空间局部特征,因此可以合理地假设任何破坏输入基本“结构”的编码都会对对可达到的准确性的影响。

【讨论】:

    【解决方案2】:

    在通常的实践中——经典实现中的离散分类任务——它不会有任何效果。然而,关键点在于反向传播的初始计算。经典定义仅取决于预测和“基本事实”类别的严格相等:简单的对/错评估。更改类编码对预测是否等于训练类没有影响。

    但是,可以更改此功能。如果您将代码更改为具有正确/错误评分以外的其他内容,这取决于编码选择,那么编码更改肯定会产生影响。例如,如果您以 1-5 的等级对电影进行评分,您可能希望 1 对 5 的损失比 4 对 5 的损失更大。

    这是否合理地解决了您的顾虑?


    我现在明白了。我上面的回答很有用……但不适用于您的要求。我关注分类编码;你想知道输入。

    请注意,要求场外资源是典型的题外话问题类别。我不知道有任何这样的研究——因为它的价值微乎其微。

    显然,应该有 一些 效果,因为您正在更改输入数据。效果将取决于特定的量化变换以及各个应用程序。

    我确实从一般大数据分析中获得了一些有限范围的观察结果。

    在我们的典型环境中,数据在其自然空间(F 维,其中 F 是特征的数量)内以某种固有的组织分散,我们经常使用两个简单的量化步骤:(1) 将所有特征值缩放到方便的整数范围,例如 0-100; (2) 识别自然微簇,用簇的质心表示所有的簇值(一般不超过输入的1%)。

    这在一定程度上加快了分析处理。考虑到细粒度的聚类,它对分类输出的影响很小。事实上,它有时提高准确性,因为聚类在数据点之间提供了更大的差距。

    持保留态度,因为这不是我们努力的主旨。

    【讨论】:

    • 它强调了对某些特定用户案例(即数据和分类结果)的依赖,谢谢。然而,这个话题似乎更大,想知道是否有任何以这种方式完成的已发表研究(例如:图像、文字、...)。
    猜你喜欢
    • 1970-01-01
    • 2018-10-05
    • 2019-12-02
    • 1970-01-01
    • 1970-01-01
    • 2020-08-09
    • 2020-05-15
    • 1970-01-01
    • 2017-04-04
    相关资源
    最近更新 更多