【问题标题】:Unusual digit classificaion with DNN使用 DNN 进行异常数字分类
【发布时间】:2016-03-04 10:33:58
【问题描述】:

我已经考虑这个问题有一段时间了,但我还没有找到一个我很满意的答案。

想象一下,我们已经在 MNIST 数字数据库上训练了一个 DNN,它以一定的高精度对样本外观察结果进行分类。然后我们向 DNN 展示 4 和 3 的异常图像,如下所示。 DNN 会正确分类吗?我不这么认为,因为隐藏层根本不会具有图像中存在的具有不寻常数字(各种卷发)的特征,因此很可能会对它们进行错误分类。

我还认为,仅对此类不寻常数字的数据库进行培训会很困难。隐藏层将如何存储(非常相似的)特征?直观地说,它会在这个 db 上过拟合,因为由于卷曲之间的相似性,隐藏的神经元将学习所有不必要的特征。

我认为训练这种 DNN 的方法是以某种方式学习组成数字的“条”/卷发之间的角度,例如在数字“4”中,条形之间有一个直角,但我不太确定。我也找不到处理这个问题的论文。

【问题讨论】:

  • 老实说,第一眼或第二眼我都不知道这张图片代表什么。但是,您是否尝试过对这些数字进行分类?除非您尝试一下,否则您将不知道是否可行。在 MNIST 上训练它并创建 A) 一个类似于 MNIST 的手写测试集 - 只是常规的手写数字,分类,作为您的控制测试,以及 B) 一组像这样的一些更古怪的数字。比较分类率并使用 A) 作为控制组。让我知道事情的后续!否则,我第二个 user2637126 的建议:模糊古怪的数字和 MNIST 同样,整体模式将通过。
  • '我不知道第一眼或第二眼图片代表什么' - 你读过这个问题吗?一开始它说“4 和 3 的不寻常图像”
  • 不,我明白了。我的观点是,我在阅读问题之前先看了这张图片,而且在我意识到它们是什么之前,我不得不看了三遍。发生这种情况的事实意味着这确实是一个难题。
  • 我们正在进入机器学习在某些识别任务上比人类更好的领域——这令人兴奋!现在,我发现验证码必须如此模糊,以至于我几乎无法阅读它们。另一个例子是在对推文进行情感分析时,例如,最难分类的推文是讽刺推文。然而,真正的人类也很难在文本中对讽刺的 cmets 进行分类!另一个例子是医学成像,其中计算机驱动的医学图像注释变得比医学专业人员更好。由于这些原因,我认为这是一个有趣的问题:)

标签: machine-learning neural-network image-recognition deep-learning conv-neural-network


【解决方案1】:

抱歉,但我认为尝试构建表示角度的特征不符合 DNN 的精神:深度学习的全部意义在于您无需手动设计此类详细特征,而是让网络学习并自动发现与目标任务最相关的特征。

对于您的问题,更“主流”的方法是采用现有的数字数据库并破坏数字图像,以便您获得类似于您的示例的图片。例如,您可以尝试用随机曲率替换 N 像素的直线。

这种方法通常用于深度学习,以增加训练数据集,同时提高网络对某种噪声的鲁棒性。因此,经典的损坏方法包括平移/旋转数字图像。

但请注意,对于您展示的两张图片,更简单的解决方案可能是模糊或像素化或降低清晰度,或者更好地计算带有裁剪的光谱变换,以便仅捕获全局/较大的形状而较小的变化被过滤掉了。

【讨论】:

  • 'blur or pixelize' - 你的意思是使用 ConvNN?
【解决方案2】:

如果您查看 MNIST 上的最佳结果,您会发现它们(我上次检查时)在训练期间的每个时期都使用弹性变形。

在您的情况下,您必须添加此类变形:弹性振荡(或?)。

如果您确定您只有此类信息,那么您可以尝试简化数字(曲线的主要部分而不是这些振荡),然后将其提供给您的 DNN。

【讨论】:

  • '如果你确定你只有这种类型的信息' - 你的意思是卷发吗?
  • 是的,卷发,这里是我所说的弹性变形:research.microsoft.com/pubs/68920/icdar03.pdf
  • MNIST 结果在添加这种变形后得到了很大改善
猜你喜欢
  • 2021-08-12
  • 2021-06-30
  • 2015-09-28
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-09-05
  • 2018-12-24
  • 1970-01-01
相关资源
最近更新 更多