【问题标题】:OCR software or homemade CNN for document processing?OCR 软件或自制 CNN 用于文档处理?
【发布时间】:2018-10-01 10:02:22
【问题描述】:

我有一个难题。如果您只有一种类型的发票/文档,并且您有一个要从该发票处理并在其他地方使用的特定字段(该字段恰好是手写数字,有时用破折号或斜线书写),您会使用一些 OCR 软件或构建自己的 CNN 来识别数字?您希望 OCR 的准确度如何?你的 CNN 会更准确吗,因为你只对特定类型的数字书写感兴趣,具有特定的图像尺寸等。在给定的情况下,什么会更好? 请记住,您不会以任何其他方式或任何其他地方使用它来识别手写数字,并且您已经有多达 100k 和更多的文档被人类复制到计算机,您可以将其用于培训和测试。

谢谢。

【问题讨论】:

  • 您可以compare online ocr APIs 了解您可以从现成的 OCR 软件中获得什么以及它对您的文档的作用。

标签: neural-network artificial-intelligence ocr conv-neural-network handwriting-recognition


【解决方案1】:

我肯定会选择基于 CNN 的解决方案。由于您的文档结构是一致的:

  1. 使用标准计算机视觉方法提取文档的所需部分
  2. 在数千个文档的注释集上训练 CNN。您甚至应该能够微调在 MNIST 上训练的现有 CNN,这将需要更少的训练图像。

这种方法可以让您毫不费力地获得 >99% 的准确率。 OCR 解决方案的准确性实际上取决于您使用的库以及您实施的预处理。

【讨论】:

  • 我同意自制解决方案是更好的选择。你说我可以使用 MNIST 来训练网络,但这并不容易,如果我没记错的话,MNIST 有 32x32 像素的图像,而且我的领域有不同的维度,所以现在你有另一个问题,你不能使用,完全连接的层,因为你只有这么多的神经元用于分类,如果你把它们扔掉,你就只有卷积单元,这并不容易。
  • 图像尺寸不是问题,因为您可以将图像大小调整为 32x32,这足以识别数字。无论如何,即使输入大小不同,大多数预训练网络也应该可以工作,但在这种情况下,您必须替换全连接层。
猜你喜欢
  • 2015-01-15
  • 2010-10-17
  • 1970-01-01
  • 2011-05-31
  • 1970-01-01
  • 2013-02-07
  • 1970-01-01
  • 1970-01-01
  • 2023-02-05
相关资源
最近更新 更多