【发布时间】:2011-12-22 17:51:36
【问题描述】:
我正在做一个需要更简单、更准确的 OCR 工具的项目
我的场景:
- 结构相同的每周图像
- 我有一个小区域需要从中获取号码
- 我需要从中获取带有连字符的文本的另一个小区域
- 字体总是一样的(这是我可以更准确的地方)
- 除了平面光栅化图像外,没有其他选项可供图像使用
- 核心软件采用 C# 语言,因此最好使用 CLI 语言。
- 图像为 300 dpi,因此有一个很好的工作基础
我会使用普通的 OCR 程序,但我知道我可以得到更准确的结果,即使不是完美的结果,因为它总是使用相同的字体。
那么,什么是好的方法?我不想从头开始写大量的工作,但我不想要一个经过预训练的过度泛化的 OCR 工具。我想在这一种字体上训练它,这样它会得到非常准确的结果。我也不想进行分离单词和查找字母行等的特征提取。
【问题讨论】:
-
如果您正在创建图像,为什么不使用条形码。这比任何 OCR 都更准确。
-
如果我正在创建图像,我不需要 OCR 来知道文本的内容。我只是在制作图像之前保存它......
-
这些图像是扫描的还是数字生成的?
-
数字化,这就是为什么一旦经过训练,使用 ocr 阅读字母非常容易