【问题标题】:Tesseract not picking up different colored text正方体没有拾取不同颜色的文本
【发布时间】:2018-01-30 20:53:38
【问题描述】:

我正在尝试制作一个程序,该程序将使用 tesseract 和 python 从屏幕截图中刮下文本,并且获取其中的一部分没有问题,但是有些文本颜色较浅,并且没有被 tesseract 拾取。以下是我正在使用的图片示例:

我要获取图片顶部的文字,而不是下面的3个选项。

这是我用来抓取文本的代码

result = pytesseract.image_to_string(
            screen, config="load_system_dawg=0 load_freq_dawg=0")

        print("below is the total value scraped by the tesseract")
        print(result)

        # Split up newlines until we have our question and answers
        parts = result.split("\n\n")

        question = parts.pop(0).replace("\n", " ")
        q_terms = question.split(" ")
        q_terms = list(filter(lambda t: t not in stop, q_terms))
        q_terms = set(q_terms)

        parts = "\n".join(parts)
        parts = parts.split("\n")

        answers = list(filter(lambda p: len(p) > 0, parts))

当我有没有彩色背景的黑色纯文本时,我可以让answers 数组由以下 3 个选项填充,但在这种情况下不是。有什么办法可以解决这个问题吗?

【问题讨论】:

    标签: python ocr tesseract python-tesseract


    【解决方案1】:

    您缺少binarization, or thresholding 步骤。

    在您的情况下,您可以简单地对灰度图像应用二进制阈值。

    这是带有threshold = 177的结果图像

    Here1 you can learn more about Thresholding with opencv python library

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2015-06-16
      • 1970-01-01
      • 1970-01-01
      • 2013-10-04
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多