【问题标题】:Python accuracy for tesseracttesseract 的 Python 准确性
【发布时间】:2017-03-07 21:14:20
【问题描述】:

我已经运行了 tesseract ocr 将图像文件转换为字符串。

现在我有输出了

我如何比较原始PNG文件和输出文本文件的准确性是否正确

basewidth = 2700
img = Image.open('D:OCR\\page1.png')
wpercent = (basewidth/float(img.size[0]))
hsize = int((float(img.size[1])*float(wpercent)))
img = img.resize((basewidth,hsize), PIL.Image.ANTIALIAS)
img.save('page1_zoom.png') 
print(image_to_string(Image.open('D:\page1_zoom.png')))

【问题讨论】:

  • 您需要手动注释数据。
  • “比较原始PNG文件和输出文本文件是否准确”是什么意思?您是否尝试使用 OCR 验证 OCR?通常你会手动验证这种事情。
  • 你在乞求这个问题 - 要验证 OCR,你需要另一个更准确的 OCR - 你没有。这意味着您可以手动验证它。

标签: python ocr tesseract floating-accuracy


【解决方案1】:

如何检查是否准确?

您肯定需要一些手动基线/黄金数据来比较结果。您将需要您的测试数据或至少要验证的参数。

Test cases could be something like: 
 1. Whole textual data 
 2. No of lines 
 3. No of Paragraphs 
 4. Position of text

Tesseract 与 Google ocr:

如果您想使用其他 OCR 测试 tesseract 准确性,那么您可以尝试 google OCR 比 tesseract 提供更好的结果(尽管它是 基于它)

Tesseract 训练:

Tesseract does provide feature of training to improve the accuracy of results. 

【讨论】:

    猜你喜欢
    • 2021-06-30
    • 2017-04-03
    • 1970-01-01
    • 2021-04-15
    • 2020-12-08
    • 1970-01-01
    • 1970-01-01
    • 2019-11-02
    • 1970-01-01
    相关资源
    最近更新 更多