【问题标题】:Scrapy, proxy not workingScrapy,代理不起作用
【发布时间】:2016-07-04 10:27:46
【问题描述】:

我正在尝试让scrapy通过代理,但没有成功。

我正在传递请求元代理,例如:

http://zqal.xyz
http://pro6y.com
http://fermatfibonacci.info
http://newproxy.ninja
etc.

当我通过 shell 键入一些随机页面时,显示的页面不是我通过的页面,而是代理页面。看起来我去的是代理页面,而不是通过代理...

可能是错误的代理链接?有什么想法吗?

我在网络浏览器中设置 USER_AGENT,并引用谷歌页面。

【问题讨论】:

  • 这些站点可能无法正常工作,因为它们并不是传统意义上的真正代理服务器,而是通过代理路由您的请求的 http 页面。你可以在这里找到一些代理服务器(它们非常不可靠,但它们是免费的):gatherproxy.com;这是您配置scrapy以使用代理的方式:stackoverflow.com/questions/4710483/scrapy-and-proxies(见第二个答案)另一种选择是使用TOR
  • @Ryan 你有一些教程,或者关于在 Ubuntu 上集成 TOR 和 Scrapy 的东西吗?
  • 要设置代理,您可以使用环境变量或设置 Request.meta 键。见这里stackoverflow.com/questions/4710483/scrapy-and-proxies你是如何设置代理的? “通过 shell 键入一些随机页面”是什么意思?
  • @PawelMiech 我将 request.meta['proxy'] 设置为某个代理地址,例如:scrapy shell http://onet.pl 但现在我尝试通过 TOR 进行连接

标签: python proxy scrapy web-crawler scrapy-spider


【解决方案1】:

您可以使用自动轮换代理的scrapy 库https://github.com/TeamHG-Memex/scrapy-rotating-proxies 来解决这个问题。如果你想要一个关于如何自动化的完整教程(结合获取代理列表)你可以在这里找到一个完整的教程:https://tinyendian.com/articles/how-to-scrape-the-web-and-not-get-caught

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-11-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-12-04
    • 2013-06-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多