【发布时间】:2017-09-22 11:01:36
【问题描述】:
我是 Tensorflow 的新手,我正在尝试构建能够对我的图像执行 OCR 的模型。我必须阅读 9 个字符(固定在所有图像中)、数字和字母。我的模型将与此类似
https://matthewearl.github.io/2016/05/06/cnn-anpr/
我的问题是,我是否应该首先针对每个字符训练我的模型,然后再组合字符以表示完整的标签。或者我应该直接训练全标签?
我知道我需要传递给模型,图像+相应图像的标签,这些标签的格式是什么,是文本文件,我对那部分有点困惑,所以关于标签格式的任何解释是传递给模型会有帮助吗?我很感激,谢谢。
【问题讨论】:
-
我建议结合所有标签进行培训。这是最干净的解决方案。如果失败,那么您可以尝试不同的方法。您通常传入一个单热编码向量作为标签。例如,对于狗和猫,标签 cat 表示为
[1,0],dog 表示为[0,1]。 -
好的,谢谢,我如何通过例如标签“17C31T2F”?
-
HASYv2 dataset 大小为 32px x 32px 的手写符号可能对您来说很有趣。
标签: python tensorflow deep-learning mnist