【发布时间】:2020-02-05 10:57:11
【问题描述】:
我正在尝试使用 requests.get() 下载 PDF 文件。它适用于我发现的大多数测试 PDF 文件,但在这种情况下它不起作用并且文件已损坏。如果我用浏览器打开 URL 并保存文件,它就可以正常工作。我尝试使用“Stream”分块下载它,但结果相同。你能解释一下我错过了什么吗?
import requests
file_url = 'http://medianet.edmond-de-rothschild.fr/edram/pdf/kiid_fr0010172767_en_20200120_20200128_1954.pdf'
headers = {'Content-type': 'application/pdf'}
r = requests.get(file_url, headers=headers)
with open("python.pdf", "wb") as pdf:
pdf.write(r.content)
pdf.close()
【问题讨论】:
-
您可能会错过根本没有下载 PDF。检查您下载的内容——它是 HTML。
-
你知道为什么它返回 HTML,尽管 url 明确以 PDF 结尾吗?我应该如何以最简单的方式获取其中的 pdf 部分?
标签: python python-3.x pdf python-requests