【发布时间】:2020-07-11 07:57:03
【问题描述】:
我正在使用 Beautiful Soup 抓取一个可以从 link 访问的网站。我们的想法是使用get 模块下载所有包含字符串.pdf 的href。
以下代码演示了该过程并按预期工作:
filename = 'new_name.pdf'
url_to_download_pdf='https://bradscholars.brad.ac.uk/https://www.brad.ac.uk/library/additional-help/bradford-scholars-faqs/digital_preservation_policy.pdf'
with open(filename, 'wb') as f:
f.write(requests.get(url_to_download_pdf).content)
但是,在某些情况下,上面给出的 URL(即变量 url_to_download_pdf)直接指向 Page not found 页面。结果,下载了一个无法使用且无法阅读的 pdf。
在 Windows 中使用 pdf 阅读器 打开文件会出现以下警告
我很好奇是否有任何方法可以避免访问和下载无效的pdf 文件?
【问题讨论】:
-
你可以使用
if response.status_code == 404,如果为真则通过
标签: python pdf get python-requests