【发布时间】:2019-05-23 12:20:52
【问题描述】:
我尝试了此代码,但包含 URL 的列表保持为空。没有错误消息,什么都没有。
from bs4 import BeautifulSoup
from urllib.request import Request, urlopen
import re
req = Request('https://www.metacritic.com/browse/movies/genre/date?page=0', headers={'User-Agent': 'Mozilla/5.0'})
html_page = urlopen(req).read()
soup = BeautifulSoup(html_page, features="xml")
links = []
for link in soup.findAll('a', attrs={'href': re.compile("^https://www.metacritic.com/movie/")}):
links.append(link.get('href'))
print(links)
我想抓取在给定 URL“https://www.metacritic.com/browse/movies/genre/date?page=0”中找到的所有以“https://www.metacritic.com/movie/”开头的 URL。
我做错了什么?
【问题讨论】:
标签: python python-3.x beautifulsoup urllib