【问题标题】:Downloading and Appending PDFs下载和附加 PDF
【发布时间】:2014-08-26 04:12:51
【问题描述】:

我正在尝试从网站下载所有 pdf 网址并将所有 pdf 附加到一个文件中。目前,我有一个包含 pdf 的所有 url 的列表。如何下载所有 pdf 并将它们附加在一起?我在下面附上了我的代码。我正在使用 Python 2.7.8。

# Download and merge pdfs
url_list = listofurl
for url in listofurl:
    outfile = os.path.basename(url)
    with open(outfile, 'w') as out:
        out.write(urllib2.urlopen(url).read())

【问题讨论】:

  • 您能否在示例代码中添加注释以显示错误发生的位置?
  • 你能告诉我们跟踪信息吗?

标签: python url pdf


【解决方案1】:

对我来说,下载有效,但在找不到文件的地方会引发异常

HTTPError: HTTP Error 404: Not Found

我不确定 python 本身是否能够合并文件。我建议使用“pdftk”并在您的文件在硬盘上后通过“子进程”模块调用它。

在 linux 系统上,一旦安装了“pdftk”(一个用于命令行的外部且非常实用的 pdf 合并器),它就会像这样工作:

from subprocess import call

call(['pdftk', '*.pdf', 'cat', 'output', 'combined.pdf'])

这不是最 Pythonic 的方式,但目前我能想到的最简单的方式。希望对您有所帮助。

【讨论】:

    猜你喜欢
    • 2013-04-06
    • 2011-02-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-03-08
    • 2014-01-04
    相关资源
    最近更新 更多