【问题标题】:How to process centered multi colored text in Tess4j and Tesseract?如何在 Tess4j 和 Tesseract 中处理居中的多色文本?
【发布时间】:2019-08-07 08:19:17
【问题描述】:

如何配置 Tess4J 和 Tesseract 以正确识别居中的多色文本?

Tesseract 只能识别下图中的第一行和最后一行:

我尝试将图像转换为灰度,但输出保持不变:

Executioners Pole Hook * * esi yee +50% more damage when your target is below 40% health

作为一种解决方法,我可以将图像拆分为多个文件,但我不想这样做。

图片是PNG,但没有注意到png和jpeg之间的任何变化。

【问题讨论】:

  • 这是您的临时结果。我通过一个简单的操作来显示中间线(99%) - 无需进一步处理。所以我不知道你在说什么。
  • @gpasch 您是在安装 tesseract v5 时没有任何额外的软件包,还是您添加了语言或字体?运行 tess4j 时我不断得到不一致的结果
  • 您是否尝试过不同的 PSM 值和图像预处理?

标签: java ocr tesseract


【解决方案1】:

我已经通过使用这些参数解决了输出的质量问题:

           instance.setTessVariable("tessedit_pageseg_mode", "7");
           instance.setLanguage("eng");
           instance.setOcrEngineMode(0);

最后一个强制 Tesseract 仅使用本地字典。启用后,我从https://github.com/tesseract-ocr/tessdata下载了英语词典

我现在还将位图转换为灰度,如果高度太短,我还会将它们放大,这样每个位图至少有 70 个像素。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-08-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多