【问题标题】:getting exception while redacting pdf using itext使用 itext 编辑 pdf 时出现异常
【发布时间】:2017-08-29 21:33:00
【问题描述】:

我在尝试使用 itext 编辑 pdf 文档时遇到异常。 这个问题非常零星,有时它正在工作,有时它会抛出错误。

at com.itextpdf.text.pdf.parser.PdfContentStreamProcessor.access$6100(PdfContentStreamProcessor.java:60)
at com.itextpdf.text.pdf.parser.PdfContentStreamProcessor$Do.invoke(PdfContentStreamProcessor.java:991)
at com.itextpdf.text.pdf.pdfcleanup.PdfCleanUpContentOperator.invoke(PdfCleanUpContentOperator.java:140)
at com.itextpdf.text.pdf.parser.PdfContentStreamProcessor.invokeOperator(PdfContentStreamProcessor.java:286)
at com.itextpdf.text.pdf.parser.PdfContentStreamProcessor.processContent(PdfContentStreamProcessor.java:425)
at com.itextpdf.text.pdf.pdfcleanup.PdfCleanUpProcessor.cleanUpPage(PdfCleanUpProcessor.java:160)
at com.itextpdf.text.pdf.pdfcleanup.PdfCleanUpProcessor.cleanUp(PdfCleanUpProcessor.java:135)
at RedactionClass.tgestRedactJavishsInput(RedactionClass.java:56)
at RedactionClass.main(RedactionClass.java:23)

我用来编辑的代码如下:

public static void testRedact() throws IOException, DocumentException {

    InputStream resource = new FileInputStream("D:/itext/edited_120192824_5 (1).pdf");
    OutputStream result = new FileOutputStream(new File(OUTPUTDIR,
            "aviteshs.pdf"));

    PdfReader reader = new PdfReader(resource);
    PdfStamper stamper = new PdfStamper(reader, result);
    int pageCount = reader.getNumberOfPages();
    Rectangle linkLocation1 = new Rectangle(440f, 700f, 470f, 710f);
    Rectangle linkLocation2 = new Rectangle(308f, 205f, 338f, 215f);
    Rectangle linkLocation3 = new Rectangle(90f, 155f, 130f, 165f);
    List<PdfCleanUpLocation> cleanUpLocations = new ArrayList<PdfCleanUpLocation>();
    for (int currentPage = 1; currentPage <= pageCount; currentPage++) {
        if (currentPage == 1) {
            cleanUpLocations.add(new PdfCleanUpLocation(currentPage,
                    linkLocation1, BaseColor.BLACK));
            cleanUpLocations.add(new PdfCleanUpLocation(currentPage,
                    linkLocation2, BaseColor.BLACK));
            cleanUpLocations.add(new PdfCleanUpLocation(currentPage,
                    linkLocation3, BaseColor.BLACK));
        } else {
            cleanUpLocations.add(new PdfCleanUpLocation(currentPage,
                    linkLocation1, BaseColor.BLACK));
        }
    }
    PdfCleanUpProcessor cleaner = new PdfCleanUpProcessor(cleanUpLocations,
            stamper);
    try {
        cleaner.cleanUp();
    } catch (Exception e) {
        e.printStackTrace();
    }
    stamper.close();
    reader.close();

}

由于客户文档,我无法分享它,试图找出一些相同的测试数据。

请在此处找到文档:

https://drive.google.com/file/d/0B-zalNTEeIOwM1JJVWctcW8ydU0/view?usp=drivesdk

【问题讨论】:

  • 请包含完整的堆栈跟踪
  • 还有一个最小的完整可验证示例,也是一个问题
  • 以及重现该问题的 PDF 文件。
  • 一个已知的可能发生这种情况的情况是 PDF 中的位图图像,iText 解析框架不知道其格式。另一方面,编校需要了解图像格式才能将编校应用于图像内容。因此,发生了一个公认没有明确指出原因的异常。您的文件是否属于这种情况,只能通过相关 PDF 和您应用的编辑操作来确定。
  • 实际上由于客户文件的原因,我无法在此处共享文件。但是是的,它由上面的标志组成,它是彩色的,可能是位图。

标签: java pdf itext ecm redaction


【解决方案1】:

简而言之:这里出现NullPointerException 的原因是iText 不支持从它们显示的页面继承表单XObject 资源。根据 PDF 规范此构造已过时,但在遵循早期 PDF 参考而非规范的 PDF 中可能会遇到这种情况。

原因

相关文档的第 1 页包含 4 个 XObject 资源,分别名为 I1M0P1Q0 >:

正如您在屏幕截图中看到的那样,Q0 尤其没有自己的 Resources 字典。但它的最后一条指令是

q
413 0 0 125 75 3086 cm
/I1 Do
Q

估计它引用了资源 I1

现在 iText 在表单 XObjects 的情况下假定其内容引用的资源包含在他们自己的 Resources 字典中。

结果:iText 访问 null 字典并出现 NullPointerException

规范

PDF 规范 ISO 32000-1 规定:

资源字典应通过以下方式之一与内容流相关联:

  • 对于作为页面 Contents 条目的值的内容流(或者是作为该条目的值的数组元素),资源字典应指定为页面字典的 Resources 或从页面对象的某个祖先节点继承,如 7.7.3.4 “页面属性的继承”中所述。

  • 对于其他内容流,符合要求的编写者应在流的字典中包含一个 Resources 条目,指定包含该内容流使用的所有资源的资源字典。这应适用于定义表单 XObject、模式、Type 3 字体和注释的内容流。

  • 按照早期版本的 PDF 编写的 PDF 文件可能省略了页面上使用的所有形式 XObjects 和 Type 3 字体的 Resources 条目。从这些表单和字体中引用的所有资源都应从使用它们的页面的资源字典中继承。此构造已过时,不应该被符合规范的作者使用。

(ISO 32000-1,第 7.8.3 节 - 资源字典)

因此,在我们目前处于过时选项三的情况下,Q0引用了页面资源字典中定义的XObject I1 >Q0用于。

有问题的文档有一个版本标题,声称符合 PDF 1.5(与 PDF 规范的 PDF 1.7 相比)。因此,让我们看一下 PDF 参考 1.5。与选项三对应的段落是:

  • 表单 XObject 或 Type 3 字体的字形描述可能会省略 Resources 条目,在这种情况下,资源将在 Resources 条目中查找 使用表单或字体的页面。 不推荐这种做法。

因此,总而言之,有问题的 PDF 使用了一种被 PDF 规范(2008 年发布,使用了 9 年!)称为过时的结构,甚至该文件声称符合建议反对的 PDF 参考。另一方面,iText 不支持这种过时的结构。

如何解决这个问题的想法

本质上,PDF Cleanup 代码必须扩展为

  • 记住当前页面的资源在PdfCleanUpProcessor
  • PdfCleanUpContentOperator 方法invoke 中使用这些当前页面资源,以防Do 运算符引用没有自己资源的表单XObject。

很遗憾,invoke 中使用的一些成员是私有的。因此,必须要么复制 PdfCleanUp 代码,要么依靠反射。

(iText 5.5.12-SNAPSHOT)

iText 7

iText 7 PDF CleanUp 工具也会遇到您的 PDF 问题,这里的例外是 IllegalStateException 声称 "Graphics state is always deleted after event dispatching. If you want to preserve it in renderer info, use preserveGraphicsState method after receiving renderer info."

由于在事件分派期间抛出此异常,因此此错误消息没有意义。不幸的是,PDF CleanUp 工具在 iText 7 中已成为封闭源代码,因此查明问题并不容易。

(iText 7.0.3-SNAPSHOT;PDF CleanUp 1.0.2-SNAPSHOT)

【讨论】:

  • 大家好,我想知道我们是否有任何其他选项或一组开源 Java API 可以帮助我在我的客户许可证到期时编辑 PDF
  • 在这种情况下,应该更新许可证。
猜你喜欢
  • 1970-01-01
  • 2014-06-09
  • 2015-06-29
  • 1970-01-01
  • 2019-12-31
  • 2018-12-14
  • 2014-09-01
  • 1970-01-01
相关资源
最近更新 更多