【发布时间】:2020-03-07 04:43:02
【问题描述】:
我需要一些帮助。我正在尝试使用“请求”库和 BeautifulSoup4 库创建一个网络爬虫,但为了成功,我必须访问一个链接来激活特定的 cookie,以便我搜索该查询的内容。
import requests
from bs4 import BeautifulSoup
def web_spider(max_pages, query):
page = 1
while page <= max_pages:
url = r'http://website.com/search/index?page=' + str(page) + '&q=' + query
source_code = requests.get(url)
plain_text = source_code.text
soup = BeautifulSoup(plain_text)
for link in soup.finaAll('a', {'class': 'comments_link'}):
href = 'http://website.com/' + link.get('href')
print(href)
page += 1
问题在于某些查询,除非某个 cookie 设置由 url 触发,否则由于未启用正确的 cookie,它不会显示任何内容。根据我的代码的当前功能,我采取的最佳行动方案是什么?
【问题讨论】:
标签: python cookies python-3.x