【问题标题】:extract dimensions from PDF using OCR使用 OCR 从 PDF 中提取尺寸
【发布时间】:2016-12-09 18:49:21
【问题描述】:

我正在寻找一种以编程方式检查 pdf cad 绘图、纯 2D 打印并提取所有尺寸以及页面上尺寸位置的方法。我正在寻找能够让我做到这一点的技术。

我正在查看 Leadtools、PDFBox、iText、TET、Adobe SDK 并尝试在它们之间进行一些比较。我对准确识别尺寸/数字和形状特别感兴趣,并且 api 还必须具有提取位置信息的能力。任何过去的这些经验或对好/坏的有用见解将不胜感激!

【问题讨论】:

    标签: pdf tesseract text-extraction leadtools-sdk


    【解决方案1】:

    我们可以提供有关您问题的 LEADTOOLS 部分的相关信息,因为它是我们的产品。

    如果 PDF 包含实际文本而不仅仅是文本图像,您可以直接提取它而无需通过 OCR。为此,请使用the Leadtools.Pdf.PDFDocument.ParsePages() method

    如果您正在处理包含文本和非文本区域的图像,您可以使用Leadtools.ImageProcessing.Core.AutoZoningCommand 来隔离文本区域(区域)并获取它们的坐标。然后,您可以使用我们的 OCR 引擎或您自己的代码。如果您尝试此操作并没有得到满意的结果,可能还有其他高级选项可以帮助您,但我们可能需要查看您正在使用的实际示例。如果您愿意,可以将一些示例文件通过电子邮件发送到我们的支持地址,并说明您到目前为止所做的尝试。

    【讨论】:

      猜你喜欢
      • 2016-08-08
      • 2021-11-02
      • 1970-01-01
      • 1970-01-01
      • 2023-03-09
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多