【问题标题】:Get text layer of a PDF as is and pass it to another PDF按原样获取 PDF 的文本层并将其传递给另一个 PDF
【发布时间】:2014-07-04 08:32:12
【问题描述】:

下午好,我的项目有个问题,这是PDF压缩,过程如下: 从 PDF 中提取图像 挂起 OCR 压缩库存 OCR + 合并图像并每页转换 PDF 将所有生成的 pdf 与 OCR、OCR PDFcon 合并为最终产品。 我的原始文件大小为 11 MB 和 4.2 MB 压缩。 整个过程完美运行,但我遇到的问题是 OCR 过程的速度。我在网上查了一下,我看到了一种绕过该过程的方法,即获取原始 PDF 的文本层并将其传递给最终的 PDF 被压缩,尝试一些代码,例如删除 PDF 的所有图像并独处用文本层,插入我的压缩图片,但问题是与上面提供的正常过程相比,文件的重量增加了4.2 MB以上,这对我来说很不方便。 在寻求另一种解决方案时,我发现通过 PDFStreamParser 、 PDStream 、 COSDictionary 使用 PDFBox 处理的处理 PDF 运算符。 运营商有TJ、TW、TZ、TC……等。 我的问题是如果有人知道通过TJ操作,这是一个包含PDF文本到另一个的操作,看看是否可以将原始PDF的文本层传递给最终的PDF在没有我的情况下压缩4.2MB高权重,这个想法是不要花费其他运算符,因为这些会增加最终 PDF 的权重,还是我弄错了? 如果您有任何其他可以帮助我的解决方案,将不胜感激? .

对不起,如果我的英语不好,如果有人懂西班牙语,请告诉我更好地表达自己。

谢谢

【问题讨论】:

    标签: pdfbox


    【解决方案1】:

    您可以使用我们的开源工具 pdf2json 从您的 pdf 中获取文本层。如果您想从 OCR 扫描文档中获取文本,请确保在使用工具时将“-hidden”作为参数传递给该工具。它支持将您的数据导出为 JSON 和 XML。看看这里:

    http://code.google.com/p/pdf2json/

    【讨论】:

    • 谢谢,但不是我想要的解决方案,我想要的是通过PDFBox提取文本层,你的解决方案我只是发送单词的位置,你在我做的正常过程中得到,我寻求的是从一个 PDF 传递到另一个。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-02-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-08-17
    • 2019-06-30
    相关资源
    最近更新 更多