【发布时间】:2018-03-14 19:16:17
【问题描述】:
旧版本的 Adobe PDF 用于以一种特定方式区分可搜索 PDF/图像 PDF。在可搜索的 PDF 中,您可以选择仅文本和图像 pdf,当您尝试选择灰色文本框时会出现(未选择文本)。这是之前的经验法则。但现在有了 Adobe DC,这种情况发生了变化。 Adobe DC,即使是图像 pdf/s(不可搜索的 pdf),也允许您选择文本。但是如果您尝试复制和粘贴,它不会粘贴您复制的内容,您会得到一些特殊字符。知道为什么 Adobe DC 会这样做吗?现在找出什么是可搜索的pdf和什么是图像pdf(非ocr pdf)的拇指规则是什么?
一些非 OCR pdf 文档在尝试进行 OCR 时出现“可渲染文本”错误,并且这些页面的 OCR 失败。消除此“此页面包含可呈现文本”错误的最佳方法是什么,以及对此类页面进行 OCR 的最佳方法是什么。
如何在 C# 中以编程方式 OCR pdf 文档?如果这需要更多时间,有什么方法可以处理会话超时?无论如何要在后台进行 OCR 并在最后发送给用户(想法是不要将用户保留在前端,并且在处理完成后仍然以某种方式将创建的文件传递给提交者)。
【问题讨论】: