【发布时间】:2019-10-03 17:24:28
【问题描述】:
我想在这个网站上抓取 PDF 的标题。但是,我得到了标题和链接。我该如何解决这个问题?
publications=[]
text=[]
for i in np.arange(12,19):
response=requests.get('https://occ.ca/our-
publications/page/{}/'.format(i), headers={'User-Agent': 'Mozilla'})
if response.status_code == 200:
soup = BeautifulSoup(response.text, 'lxml')
pdfs = soup.findAll('div', {"class": "publicationoverlay"})
links = [pdf.find('a').attrs['href'] for pdf in pdfs]
publications.extend(links)
text.extend(pdfs)
任何帮助将不胜感激。
【问题讨论】:
标签: python web-scraping beautifulsoup