【发布时间】:2016-07-26 08:49:33
【问题描述】:
我必须废弃网站中的一个页面,我必须向该页面发布参数,但我有一个值数组来请求相同的页面。我不想按顺序废弃数组的每个值的页面。我想并行废弃它(这意味着搜索“google.com/query=a”并搜索“google.com/query=b”我想并行运行这两个请求(现在我无法运行,因为网站登录限制,如下所示。 问题是该站点一次只允许每个帐户的登录会话,这意味着如果该帐户是通过浏览器登录的,那么如果我们尝试使用任何其他浏览器(隐身模式)再次登录,登录的会话将被注销.
现在,我想有两种可能,首先,我应该能够在登录后将cookie值保存在一个文件中,这样当同一个蜘蛛以不同的参数运行时我可以使用同一个cookie。但是我尝试设置 Cookie,但 cookie 未正确设置为请求。所以请求失败。(如果我可以保存 cookie 并可以手动设置请求,那么我想使用具有不同参数值的 scrapyd 运行蜘蛛)
第二个:当我请求该页面时,我必须通过多处理或使用 python 默认库并行废弃页面。
但正如我看到的一些帖子,在他们建议的抓取时,多处理并不好。
有没有人对此有任何想法或者可以保存一个 cookie 以将其用于下一个蜘蛛实例?我可以更新所有尝试过的代码,但它会非常庞大,所以等待有人帮助我可以更新我尝试过的代码。
【问题讨论】:
标签: python cookies scrapy scrapy-spider scrapyd