【发布时间】:2019-12-19 01:59:51
【问题描述】:
我对 cookie 协议页面感到头疼...
我在做什么:
import requests
url = "https://stockhouse.com/community/bullboards/"
r = requests.get(url)
soup = BeautifulSoup(r.content, "html.parser")
print(soup)
从 cookie 协议页面返回 HTML。然后我正在寻找的是绕过此页面并在我们接受 cookie 后抓取实际页面的内容...
我尝试了question中的代码:
cookies = dict(BCPermissionLevel='PERSONAL')
html = requests.get(website, headers={"User-Agent": "Mozilla/5.0"}, cookies=cookies)
但我仍然从 cookie 页面获取 html。
注意:我成功使用了 Selenium,但是 selenium 是一个非常低效的最后手段......
【问题讨论】:
标签: python web-scraping python-requests