【发布时间】:2016-07-04 10:27:46
【问题描述】:
我正在尝试让scrapy通过代理,但没有成功。
我正在传递请求元代理,例如:
http://zqal.xyz
http://pro6y.com
http://fermatfibonacci.info
http://newproxy.ninja
etc.
当我通过 shell 键入一些随机页面时,显示的页面不是我通过的页面,而是代理页面。看起来我去的是代理页面,而不是通过代理...
可能是错误的代理链接?有什么想法吗?
我在网络浏览器中设置 USER_AGENT,并引用谷歌页面。
【问题讨论】:
-
这些站点可能无法正常工作,因为它们并不是传统意义上的真正代理服务器,而是通过代理路由您的请求的 http 页面。你可以在这里找到一些代理服务器(它们非常不可靠,但它们是免费的):gatherproxy.com;这是您配置scrapy以使用代理的方式:stackoverflow.com/questions/4710483/scrapy-and-proxies(见第二个答案)另一种选择是使用TOR
-
@Ryan 你有一些教程,或者关于在 Ubuntu 上集成 TOR 和 Scrapy 的东西吗?
-
要设置代理,您可以使用环境变量或设置 Request.meta 键。见这里stackoverflow.com/questions/4710483/scrapy-and-proxies你是如何设置代理的? “通过 shell 键入一些随机页面”是什么意思?
-
@PawelMiech 我将 request.meta['proxy'] 设置为某个代理地址,例如:
scrapy shell http://onet.pl但现在我尝试通过 TOR 进行连接
标签: python proxy scrapy web-crawler scrapy-spider