【发布时间】:2020-04-23 17:27:19
【问题描述】:
我有以下截图:
我想从该图像中提取手稿字数,在这种情况下为3.574(见下面的红色矩形)。
为此,我运行以下脚本:
magick screenshot.png -crop 33x20+2+83 screenshot-cropped.png
tesseract screenshot-cropped.png screenshot-ocred -l eng
第一行去掉字数的地方,保存在screenshot-cropped.png,如下所示:
tesseract screenshot-cropped.png screenshot-ocred -l eng 应该能够识别字符并将它们保存为screenshot-ocred.txt 中的文本。
但是,它会产生以下错误:
C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>ocr.bat
C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>magick screenshot.png -crop 33x20+2+83 screenshot-cropped.png
C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>tesseract screenshot-cropped.png screenshot-ocred -l eng
Tesseract Open Source OCR Engine v5.0.0-alpha.20200328 with Leptonica
Empty page!!
Empty page!!
我该如何解决它,我。 e.让 Tesseract 识别3.574 并将其保存在screenshot-ocred.txt 中?
注意:所有这些都在 Windows 上运行。这是magick --version的输出:
C:\usr\dp\ref\marcomm\2020_04_22_wordCounter>magick --version
Version: ImageMagick 7.0.10-7 Q16 x64 2020-04-20 http://www.imagemagick.org
Copyright: Copyright (C) 1999-2018 ImageMagick Studio LLC
License: http://www.imagemagick.org/script/license.php
Visual C++: 180040629
Features: Cipher DPC Modules OpenCL OpenMP(2.0)
Delegates (built-in): bzlib cairo flif freetype gslib heic jng jp2 jpeg lcms lqr lzma openexr pangocairo png ps raw rsvg tiff webp xml zlib
【问题讨论】: