【问题标题】:Issues when trying to OCR PDFs using .NET/C#尝试使用 .NET/C# 对 PDF 进行 OCR 时出现问题
【发布时间】:2018-03-14 19:16:17
【问题描述】:
  1. 旧版本的 Adob​​e PDF 用于以一种特定方式区分可搜索 PDF/图像 PDF。在可搜索的 PDF 中,您可以选择仅文本和图像 pdf,当您尝试选择灰色文本框时会出现(未选择文本)。这是之前的经验法则。但现在有了 Adob​​e DC,这种情况发生了变化。 Adobe DC,即使是图像 pdf/s(不可搜索的 pdf),也允许您选择文本。但是如果您尝试复制和粘贴,它不会粘贴您复制的内容,您会得到一些特殊字符。知道为什么 Adob​​e DC 会这样做吗?现在找出什么是可搜索的pdf和什么是图像pdf(非ocr pdf)的拇指规则是什么?

  2. 一些非 OCR pdf 文档在尝试进行 OCR 时出现“可渲染文本”错误,并且这些页面的 OCR 失败。消除此“此页面包含可呈现文本”错误的最佳方法是什么,以及对此类页面进行 OCR 的最佳方法是什么。

  3. 如何在 C# 中以编程方式 OCR pdf 文档?如果这需要更多时间,有什么方法可以处理会话超时?无论如何要在后台进行 OCR 并在最后发送给用户(想法是不要将用户保留在前端,并且在处理完成后仍然以某种方式将创建的文件传递给提交者)。

【问题讨论】:

    标签: c# pdf ocr


    【解决方案1】:
    1. 如果 PDF 页面包含没有文本的图像,则从中获取文本的唯一方法是使用 OCR。 Adobe Acrobat DC 和一些早期版本的 Acrobat 都具有 OCR 功能,但据我所知,您只能 OCR 一个或多个页面,而不是一小部分。
      这意味着,如果您有一个图像,并且 Acrobat 允许您在不显式运行 OCR 的情况下从中选择文本,则很可能该文件已经包含图像上的图像或图像上的隐藏文本。如果文本在复制和粘贴时出现乱码,则可能是它在 OCR 和保存时的存储方式。发生这种情况的原因可能是文本质量不够好,无法进行 OCR,或者用于执行 OCR 的软件质量低劣,无法正确获取字符。
    2. 如果您尝试 OCR 并得到“页面包含可渲染文本”错误,这意味着文件已经包含文本。同样,文本可以被隐藏,但它就在那里。以下文章对此进行了详细说明:
      https://helpx.adobe.com/acrobat/kb/error-could-perform-recognition-acrobat.html

    3. 有几个 SDK 支持使用 C# 打开和 OCRing PDF 文件。 StackOverflow 的这个区域不是寻求建议的地方。请改用https://softwarerecs.stackexchange.com/

    【讨论】:

      猜你喜欢
      • 2022-10-15
      • 1970-01-01
      • 2021-12-17
      • 2022-07-22
      • 2011-04-22
      • 2011-10-07
      • 2020-06-19
      • 2020-08-29
      • 1970-01-01
      相关资源
      最近更新 更多