【问题标题】:How to crawl a website that uses cookies while integrating IP proxy?如何在集成 IP 代理的同时抓取使用 cookie 的网站?
【发布时间】:2016-02-06 11:23:00
【问题描述】:

我正在创建一个使用多个 IP 代理的爬虫。每当我尝试在没有代理的情况下爬取网站时,我都能够获取 html 源,但是当我尝试启用 ip 代理时,它总是失败并抛出异常(远程服务器返回错误:(403)禁止访问。 )

在查看提琴手时,网站似乎在访问时存储了 cookie。但是如果启用了代理,它会在获取响应部分失败。

我不明白为什么没有使用代理设置 cookie?是导致它的cookies的代理服务器设置吗?或者我可以在启用代理的同时做些什么?

顺便说一句,我使用的是 C#,但问题似乎与语言无关。

【问题讨论】:

    标签: c# cookies proxy web-crawler scraper


    【解决方案1】:

    要考虑的另一件事是,您从非代理机器的 ip 地址设置了一个 cookie(有效),然后当您从另一个 ip 地址发送具有相同 cookie 的另一个请求时,可能会阻止您。

    某些网络级软件会查看此类内容,可能会将您标记为恶意爬虫或匿名 Tor 浏览器。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2014-03-12
      • 1970-01-01
      • 2021-01-31
      • 1970-01-01
      • 2011-07-03
      • 1970-01-01
      相关资源
      最近更新 更多