Toms 的回答对我来说非常有效,甚至是我在 Windows 7 中工作以爬取需要登录的网站的唯一方法。但是,对于 Windows 10 和 Chrome 80 cookie 处理(SameSite Cookies),似乎有一种新的加密方式——“get_cookies”方法提供的 cookie 具有所有空值(Python 3)。
现在对我有用的是browser_cookie3(browsercookie 的分支,几天前才更新以与 Chrome 80 一起使用)。我将它与 request 和 selenium 一起使用。
安装在提升的提示中使用
pip3 install browser-cookie3
随请求使用:
import browser_cookie3
cookies = browser_cookie3.chrome(domain_name='.google.com')
response = requests.get('http://www.google.com', verify=False, headers=headers, cookies=cookies, timeout=3)
用您需要的 cookie 的域交换 google.com。并确保包含超时参数,否则您的脚本可能会冻结。
headers 只是一个包含所有标题的对象,例如
headers = {
"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.122 Safari/537.36",
"Accept-Encoding":"gzip, deflate",
"Accept":"text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8",
"DNT":"1",
"Connection":"close",
"Upgrade-Insecure-Requests":"1"
}
或类似的东西。
与硒一起使用:
import browser_cookie3
driver = webdriver.Chrome('./chromedriver')
cookies = browser_cookie3.chrome(domain_name='.google.com')
for c in cookies:
cookie = {'domain': c.domain, 'name': c.name, 'value': c.value, 'secure': c.secure and True or False}
driver.add_cookie(cookie)
driver.get('http://www.google.com')
./chromedriver 是我的 chromedriver.exe 所在的位置。