【问题标题】:Tensorflow model for OCR用于 OCR 的 TensorFlow 模型
【发布时间】:2017-09-22 11:01:36
【问题描述】:

我是 Tensorflow 的新手,我正在尝试构建能够对我的图像执行 OCR 的模型。我必须阅读 9 个字符(固定在所有图像中)、数字和字母。我的模型将与此类似

https://matthewearl.github.io/2016/05/06/cnn-anpr/

我的问题是,我是否应该首先针对每个字符训练我的模型,然后再组合字符以表示完整的标签。或者我应该直接训练全标签?

我知道我需要传递给模型,图像+相应图像的标签,这些标签的格式是什么,是文本文件,我对那部分有点困惑,所以关于标签格式的任何解释是传递给模型会有帮助吗?我很感激,谢谢。

【问题讨论】:

  • 我建议结合所有标签进行培训。这是最干净的解决方案。如果失败,那么您可以尝试不同的方法。您通常传入一个单热编码向量作为标签。例如,对于狗和猫,标签 cat 表示为 [1,0],dog 表示为 [0,1]
  • 好的,谢谢,我如何通过例如标签“17C31T2F”?
  • HASYv2 dataset 大小为 32px x 32px 的手写符号可能对您来说很有趣。

标签: python tensorflow deep-learning mnist


【解决方案1】:

我建议认真训练端到端 OCR 模型。你可以试试我们用来转录街道名称的 Attention OCR https://github.com/tensorflow/models/tree/master/research/attention_ocr

我猜它应该很适合你的情况。有关如何为其准备数据的说明,请参阅答案https://stackoverflow.com/a/44461910

【讨论】:

  • 感谢 Alexander 的回复,我会尽量按照您建议的方式去做。
  • 嗨,Alexander,您认为注意力 ocr 模型适用于车牌吗?例如这样的车牌:i.cbc.ca/1.3112890.1434422741!/fileImage/httpImage/… 假设我们有足够的数据进行训练,你知道模型可以达到的近似准确度是多少吗?谢谢。
  • @thug_ 你试过注意力 ocr 了吗?对你起作用吗?谢谢。
  • 嗨,鲍勃,很遗憾,我无法让它为自己工作。对于那个项目,我们使用了不使用 AI 的不同 ocr 解决方案。
【解决方案2】:

有几种方法可以解决这个问题(以下列表并不详尽)。

1) 第一个是直接从您的图像中进行单词分类。如果您的 9 个字符的词汇量有限,您可以训练一个特定于单词的分类器。然后,您可以将此分类器与您的图像进行卷积,并选择概率最高的单词。

2) 第二种选择是训练一个字符分类器,查找图像中的所有字符,并找到最有可能包含您要查找的 9 个字符的行。

3)第三个选项是训练一个文本检测器,找到所有可能的文本框。然后使用基于序列的模型阅读所有文本框,并选择最可能符合您的约束的解决方案。以下论文介绍了一个简单的基于序列的模型:http://ai.stanford.edu/~ang/papers/ICPR12-TextRecognitionConvNeuralNets.pdf。其他基于序列的模型可以基于 HMM、连接主义时间分类、基于注意力的模型等。

4) 第四个选项是基于注意力的模型,它端到端工作,首先找到文本,然后一个接一个地输出字符。

请注意,此列表并不详尽,可以有多种不同的方法来解决此问题。其他选项甚至可以使用 Abbyy 或 Tesseract 等第三方解决方案来帮助解决您的问题。

【讨论】:

  • 谢谢,有没有可用于 1、2 和 4 的示例。您认为哪种方式最好,哪种方式最容易使用,为什么?
猜你喜欢
  • 2019-05-29
  • 2019-09-26
  • 2017-09-10
  • 2018-11-29
  • 1970-01-01
  • 2020-11-13
  • 2017-02-10
  • 1970-01-01
  • 2018-12-31
相关资源
最近更新 更多