【发布时间】:2015-01-25 20:53:49
【问题描述】:
我正在尝试从 pdf 中提取图像。 pdfbox 能够从大多数 pdf 中提取图像,但它们是一些 pdf,其图像没有被 pdfbox 提取。
为了提取图像,我使用以下代码: Not able to extract images from PDFA1-a format document
您可以从此链接下载一个包含此问题的示例 pdf: http://myslams.com/test/2.pdf
是他们的代码有问题,可能是我忘记处理的代码,还是他们的 pdf 有问题?
【问题讨论】:
-
为了提取我使用以下代码的图像 - 你的意思是来自其他问题的代码还是根据@Tilman 的答案改编的代码。
-
@mkl 代码根据 tilman 改编
-
我得到 在此服务器上找不到请求的 URL /test/2.pdf。 就像您提到的 URL 上没有 PDF 一样,可能没有图片在你提到的地方。也许您正在尝试提取一个表单 XObject,假设它是一个图像 XObject。在人眼看来可能是图像,实际上可能是一堆线条和形状,而不是实际图像。
-
我也收到 404,在此服务器上找不到请求的 URL /test/2.pdf。 @sameersingh 请检查您的链接
-
由于机密性,我不得不删除 pdf 文件。抱歉...明天将放入示例 PDF 文件