【发布时间】:2022-11-16 00:58:08
【问题描述】:
我使用zlib python 库来解码使用FlateDecode 压缩的流。到目前为止,我使用过的所有 pdf 文件都在 Tj 和 TJ 运算符中显示了正确的值,但我在解码此 pdf 时遇到问题,因为我没有得到 PDF 中显示的内容。
我能够将文本从 PDF 复制到记事本而没有任何问题,而且pdftotext 正在以正确的单词作为输出给出预期结果。
我还使用 Adobe Preflight 来查看文档的内部结构,以仔细检查我通过 zlib 获得的解码文本,但即使这样也显示垃圾值,并且与 PDF 中显示的内容不匹配。
为什么我在文本运算符中得到这个垃圾值,pdftotext 如何仍然能够得到正确的结果?
另外,如何通过 python/zlib 获得正确的结果?
【问题讨论】:
标签: pdf fonts zlib acrobat text-extraction