【发布时间】:2016-08-31 19:41:36
【问题描述】:
我正在尝试使用 requests 库来抓取网站。但是,我尝试访问的特定网站 (http://www.vi.nl/matchcenter/vandaag.shtml) 有一个非常侵入性的 cookie 声明。
我正在尝试按如下方式访问该网站:
from bs4 import BeautifulSoup as soup
import requests
website = r"http://www.vi.nl/matchcenter/vandaag.shtml"
html = requests.get(website, headers={"User-Agent": "Mozilla/5.0"})
htmlsoup = soup(html.text, "html.parser")
这将返回一个网页,该网页仅包含 cookie 语句和一个接受的大按钮。如果您尝试在浏览器中访问此页面,您会发现按下按钮会将您重定向到请求的页面。如何使用requests 做到这一点?
我考虑过使用mechanize.Browser,但这似乎是一种相当迂回的做法。
【问题讨论】:
标签: python cookies beautifulsoup python-requests