【问题标题】:Improving tesseract performance for specific tasks提高特定任务的 tesseract 性能
【发布时间】:2014-01-03 07:05:42
【问题描述】:

我已经阅读了this问题的答案。

我有一系列图片,其中包含 3-10 个字符之间的单个单词。它们是在计算机本身上创建的图像,因此图像质量是一致的,并且图像上没有任何噪点。字体很大(大约 30 像素高)。这应该已经很容易让 tesseract 准确读取,但是我可以使用哪些技术来提高速度,即使它只是几毫秒的改进?

字符集仅由大写字母组成。由于这种情况下的 OCR 任务非常具体,如果我用这种特定的字体和字体大小训练 tesseract 引擎会有帮助吗?还是有点矫枉过正?

编辑以包含示例

除了 tesseract 之外,还有其他可以提供更好性能的 C/C++ 解决方案吗?使用 OpenCV 可以更快地完成吗?与Linux兼容者优先。

样本

【问题讨论】:

  • 你能展示一些示例输入图像吗?一张图片胜过一千个字;)
  • 我已经包含了一个示例。稍后我会添加更多内容。
  • 你知道所有可能的单词吗?
  • 不,我不知道所有可能的词。

标签: c++ performance opencv ocr tesseract


【解决方案1】:

如果所有字母的大小和样式都相同,您可以尝试一些非常简单的方法,例如运行 blob 检测,然后对单个字母进行模板匹配。我不确定它将如何与 tesseract 进行比较,但这是一个非常简单的实验。 (此外,降低分辨率会加快速度......) 也可以看看这个问题:Simple Digit Recognition OCR in OpenCV-Python,可能有关系

【讨论】:

  • 在这种情况下速度是原来的两倍!
猜你喜欢
  • 2012-09-23
  • 2023-01-05
  • 2019-09-16
  • 1970-01-01
  • 2021-08-16
  • 2021-06-30
  • 2020-12-08
  • 1970-01-01
  • 2017-04-03
相关资源
最近更新 更多