【发布时间】:2017-11-02 04:07:22
【问题描述】:
有没有办法通过 python 计算 pdf 文档中的图像数量(JPEG、PNG、JPG)?
【问题讨论】:
有没有办法通过 python 计算 pdf 文档中的图像数量(JPEG、PNG、JPG)?
【问题讨论】:
您可能想看看 poppler-utils 包中的 pdfimages。
我从-Sample PDF获取了样本 pdf
在运行以下命令时,会提取 pdf 中存在的图像 -
pdfimages /home/tata/Desktop/4555c-5055cBrochure.pdf image
从这本小册子中提取的一些图片是 -
所以,你可以使用python的subprocess模块来执行这个命令,然后提取所有的图片。
注意:这种方法有一些缺点。它生成 ppm 格式的图像,而不是 jpg。此外,可能会提取一些额外的图像,这些图像实际上可能不是 pdf 中的图像。
如果您想使用 pdfminer 执行此操作,请查看此博客文章 - Extracting Text & Images from PDF Files
Pdfminer 允许您遍历特定 pdf 页面的布局。下图显示了布局对象以及pdfminer生成的树结构-
Layout Objects and Tree Structure
图片来源-Pdfminer Docs
因此,提取 LTFigure 对象可以帮助您提取/计数 pdf 文档中的图像。
注意:请注意,这两种方法可能都不准确,其准确性很大程度上取决于您处理的 pdf 文档的类型。
【讨论】:
我认为这不能直接完成。虽然我使用以下方法做了类似的事情
【讨论】: