【发布时间】:2014-01-03 07:05:42
【问题描述】:
我已经阅读了this问题的答案。
我有一系列图片,其中包含 3-10 个字符之间的单个单词。它们是在计算机本身上创建的图像,因此图像质量是一致的,并且图像上没有任何噪点。字体很大(大约 30 像素高)。这应该已经很容易让 tesseract 准确读取,但是我可以使用哪些技术来提高速度,即使它只是几毫秒的改进?
字符集仅由大写字母组成。由于这种情况下的 OCR 任务非常具体,如果我用这种特定的字体和字体大小训练 tesseract 引擎会有帮助吗?还是有点矫枉过正?
编辑以包含示例
除了 tesseract 之外,还有其他可以提供更好性能的 C/C++ 解决方案吗?使用 OpenCV 可以更快地完成吗?与Linux兼容者优先。
样本
【问题讨论】:
-
你能展示一些示例输入图像吗?一张图片胜过一千个字;)
-
我已经包含了一个示例。稍后我会添加更多内容。
-
你知道所有可能的单词吗?
-
不,我不知道所有可能的词。
标签: c++ performance opencv ocr tesseract