【发布时间】:2021-06-03 22:38:29
【问题描述】:
我附上了一个非常简单的文本图像,我想从中获取文本。它是黑色背景的白色。在肉眼看来,它似乎绝对清晰易读,但显然对它进行镶嵌是垃圾。我尝试更改 oem 和 psm 参数,但似乎没有任何效果。请注意,这适用于除此之外的其他图像。
请尝试在您的机器上运行它,看看它是否有效。否则我可能不得不完全改变我的 ocr 引擎。
注意:在我尝试在图像周围添加黑色像素以帮助提取过程之前,它一直在工作。另外我不认为 tesseract 是在白色背景上的黑色文本上训练的。它也应该能够做到这一点。此外,如果这是真的,为什么它适用于与此格式相同的其他文本图像
编辑:奇迹般地,我再次尝试运行脚本,这次它能够正确提取 Chand,但在下面提到的情况下失败了。另请查看我使用的参数。我已经阅读了文档,我觉得这将是正确的选择。我已添加图片供您参考。这不仅仅是这张图片。为什么 tesseract 对于如此简单的用例会失败?
【问题讨论】:
-
请完成编辑
标签: python opencv ocr python-tesseract