【发布时间】:2012-04-14 07:18:00
【问题描述】:
如何将带有pdf扩展名的url的内容转换为文本以便在PHP中解析而不下载?
我见过的唯一方法(不包含垃圾字符)是将文件下载到服务器文件夹并壳一个可执行文件,将二进制文件转换为文本。
以下是我找到的一些可执行库: TET,文本提取工具包 xpdf
我更愿意在不先下载 pdf 的情况下转换 URL pdf(例如打开二进制文件然后转换)。
有没有办法在不下载 PHP 的 pdf 的情况下做到这一点?
推荐什么方法来最快的执行时间?
作为一个简短的说明,我将做大约 64 个带有 pdf 扩展名的 URL,并不是所有这些 url 实际上都指向一个 pdf。事实上,其中一些 url 可能指向别名 html 页面,不一定是 pdf 文件,因此在使用转换工具之前需要辨别差异。
【问题讨论】:
-
你为什么不想下载它们?这似乎是一个相当随意的限制,知道为什么可以帮助别人给你建议。
-
主要是为了阻止硬盘访问,因为我要翻几千个pdf。根据 pdf 的大小,它还会导致下载时的执行时间成为瓶颈。我相信 file_get_contents 使用内存并且不访问硬盘。我需要一些可以获取 pdf 内容并将其转换为文本的东西。
-
你可以控制服务器设置的超时时间吗?如果您计划一次通过数千次,则很可能需要比默认超时时间更长的时间。
-
是的。我已将 ini 时间重置为大约几个小时,所以我不必担心太多。