【发布时间】:2021-09-27 20:07:43
【问题描述】:
我想下载https://www.mdpi.com/search?authors=University+of+Alabama%2C+Tuscaloosa页面上列出的所有259个PDF,例如:
<a href="/1424-8220/21/19/6384/pdf" class="UD_Listings_ArticlePDF" onclick="if (!window.__cfRLUnblockHandlers) return false; ga('send', 'pageview', '/1424-8220/21/19/6384/pdf');" title="Article PDF" data-cf-modified-fa685c2bcda960230d46973e-="">
<i class="material-icons">get_app</i>
</a>
href只有域后的URL部分,所以完整的URL是https://mdpi.com/1424-8220/21/19/6384/pdf。
当我运行它来下载文件时:
for link in links:
if ('/pdf' in link.get('href', [])):
i += 1
print("Downloading file: ", i)
response = requests.get(link.get('href'))
我得到了这个回溯:
requests.exceptions.MissingSchema: Invalid URL '/1424-8220/21/19/6384/pdf': No schema supplied. Perhaps you meant http:///1424-8220/21/19/6384/pdf?
我将 URL 的缺失部分“https://mdpi.com”放在哪里?
【问题讨论】:
标签: python pdf beautifulsoup python-requests python-requests-html