【问题标题】:Pytesseract - output is extremely inaccurate (MAC)Pytesseract - 输出非常不准确(MAC)
【发布时间】:2021-01-20 02:10:29
【问题描述】:

我通过 pip 安装了 pytesseract,结果很糟糕。

当我搜索它时,我想我需要给它更多数据 但我找不到放置 tessedata(traineddata) 的位置 因为没有像使用 Mac 的 ProgramFile\Tesseract-OCR 这样的目录。

图像的分辨率、字体或大小没有问题。 Image whose result is 'ecient Sh Abu'

因为大而清晰的测试图像工作正常,我认为这是缺乏数据的问题。 但任何其他可能的解决方案都受到欢迎,只要它可以使用 Python 读取文本。

请帮帮我..

【问题讨论】:

  • 您能否详细说明“运行状况非常差”的含义?听起来您没有得到正确的结果,并且不确定将训练数据放在哪里?
  • 这正是我的意思。即使我放置了足够大且清晰的图像,它也无法正确识别。由于在搜索但放置数据的数小时内我没有找到问题的答案,我质疑我应该将数据放在哪里,但我不确定这是什么原因。谢谢你试图帮助我,对不起我的英语不好..

标签: python text python-tesseract


【解决方案1】:

我通过 pip 安装了 pytesseract,结果很糟糕。

有时您需要对输入图像进行预处理以获得准确的结果。

因为大而清晰的测试图像工作正常,我认为这是缺乏数据的问题。但任何其他可能的解决方案都受到欢迎,只要它可以使用 Python 读取文本。

您可以说缺少数据是个问题。我想你会发现morphological-transformations 很有用。

例如,如果我们应用close 操作,结果将是:

图片看起来与发布的原始图片相似。但是输出图像有细微的变化(即语法词与原始图像略有不同)

现在如果我们读取输出图像:

English
Grammar Practice
ter K-SAT (1-10)

代码:

import cv2
from pytesseract import image_to_string

img = cv2.imread("6Celp.jpg")
gry = cv2.cvtColor(img, cv2.COLOR_BGR2GRAY)
opn = cv2.morphologyEx(gry, cv2.MORPH_OPEN, None)
txt = image_to_string(opn)
txt = txt.split("\n")
for i in txt:
    i = i.strip()
    if i != '' and len(i) > 3:
        print(i)

【讨论】:

  • 感谢您的帮助!
  • @Windowsill 如果您正在处理旋转的图像,请确保搜索图像倾斜和校正。
猜你喜欢
  • 2020-09-12
  • 1970-01-01
  • 2021-01-13
  • 2021-06-15
  • 2011-06-29
  • 1970-01-01
  • 2012-07-21
  • 2015-02-10
相关资源
最近更新 更多