【发布时间】:2015-10-20 11:08:04
【问题描述】:
我在一个目录中有大约一百个长 PDF 文件,想知道 R 是否可以计算每个文件中有多少页。我的操作系统是 Windows 8。
这是一个 10 页的 PDF 文件的链接,以帮助您测试您的解决方案。 MWE pdf file
似乎可以用 python 计算 PDF 页面,但我不知道那种语言 python solution。其他解决方案已经在 SO 上使用,例如 Imagemagick 进行了讨论。和 C##。
【问题讨论】:
-
如果
Rpoppler::PDF_info(filename)$Pages不起作用,那么(可能)最快的方法是获取poppler for Windows 并使用system2在文件上运行pdfinfo并提取Pages:行。 -
请注意,
Rpoppler似乎不适用于 Windows。 -
我没有尝试让它在 Windows 上编译(我也不得不在 OS X 上使用
type="source")但是自从 Kurt 做了它之后,我假设如果所有的星星都对齐在 Windows 盒子上它可以工作。另一种选择是使用standalone poppler tools for Windows 并使用system2检测pdfinfo并获取Pages:行。 -
我没有尝试从源代码安装它,因为说明文件指出“OS_type: unix
. But having just tried now, I get the errorERROR: Unix-only package”。我很抱歉,我之前的评论太短了。我本来打算分享这个限制,以便说为 Windows 安装 poppler 工具可能是要走的路。我会继续努力,看看我是否能找到一个可行的解决方案。 -
不用担心,但我不会花太多时间。让 R 编译的东西在 Windows 上工作是一门黑暗的艺术。
poppler有如此多的大规模依赖项,因此努力可能不会有成果。这个问题大部分源于 R 强加的工具链。我不确定 python 人是否有这样的限制。