【问题标题】:Why does Tesseract fail with "Empty page" with this image?为什么 Tesseract 会因此图像的“空页”而失败?
【发布时间】:2020-04-23 17:27:19
【问题描述】:

我有以下截图:

我想从该图像中提取手稿字数,在这种情况下为3.574(见下面的红色矩形)。

为此,我运行以下脚本:

magick screenshot.png -crop 33x20+2+83 screenshot-cropped.png
tesseract screenshot-cropped.png screenshot-ocred -l eng

第一行去掉字数的地方,保存在screenshot-cropped.png,如下所示:

tesseract screenshot-cropped.png screenshot-ocred -l eng 应该能够识别字符并将它们保存为screenshot-ocred.txt 中的文本。

但是,它会产生以下错误:

C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>ocr.bat

C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>magick screenshot.png -crop 33x20+2+83 screenshot-cropped.png

C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>tesseract screenshot-cropped.png screenshot-ocred -l eng
Tesseract Open Source OCR Engine v5.0.0-alpha.20200328 with Leptonica
Empty page!!
Empty page!!

我该如何解决它,我。 e.让 Tesseract 识别3.574 并将其保存在screenshot-ocred.txt 中?

注意:所有这些都在 Windows 上运行。这是magick --version的输出:

C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>magick --version
Version: ImageMagick 7.0.10-7 Q16 x64 2020-04-20 http://www.imagemagick.org
Copyright: Copyright (C) 1999-2018 ImageMagick Studio LLC
License: http://www.imagemagick.org/script/license.php
Visual C++: 180040629
Features: Cipher DPC Modules OpenCL OpenMP(2.0)
Delegates (built-in): bzlib cairo flif freetype gslib heic jng jp2 jpeg lcms lqr lzma openexr pangocairo png ps raw rsvg tiff webp xml zlib

【问题讨论】:

    标签: ocr tesseract


    【解决方案1】:

    在 Tesseract 调用中添加 --psm 7 解决了问题 (tesseract screenshot-cropped.png screenshot-ocred -l eng --psm 7)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2013-04-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-08-17
      • 1970-01-01
      • 2011-04-30
      相关资源
      最近更新 更多