【问题标题】:I want to extract table information from OCR Data我想从 OCR 数据中提取表格信息
【发布时间】:2019-06-13 21:21:09
【问题描述】:

我想从 OCR 数据中提取表格信息,我有原始文本,它是文本。 我尝试了 pytesseract 但找不到实际的实现。

这是一张图片:https://drive.google.com/open?id=1CGJwbmf5snoXvwlQAsRAxIRRixbT_Q8l

我试过这个:https://github.com/WZBSocialScienceCenter/pdftabextract

这个方法根本不适合我。

我想从 OCR 数据中获得此表的表格结构,以供我进一步处理。

【问题讨论】:

    标签: python image ocr pytesser


    【解决方案1】:

    pdftabextract 不是 OCR。它需要使用 OCR 扫描的页面 信息,即“三明治 PDF”,其中包含扫描的 图像和识别的文本。您需要像 tesseract 或 用于 OCR 的 ABBYY Finereader。

    请尝试 tesseract,它的实现相对简单。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2012-12-15
      • 2019-09-06
      • 2023-04-01
      • 1970-01-01
      相关资源
      最近更新 更多