【发布时间】:2016-02-06 11:23:00
【问题描述】:
我正在创建一个使用多个 IP 代理的爬虫。每当我尝试在没有代理的情况下爬取网站时,我都能够获取 html 源,但是当我尝试启用 ip 代理时,它总是失败并抛出异常(远程服务器返回错误:(403)禁止访问。 )
在查看提琴手时,网站似乎在访问时存储了 cookie。但是如果启用了代理,它会在获取响应部分失败。
我不明白为什么没有使用代理设置 cookie?是导致它的cookies的代理服务器设置吗?或者我可以在启用代理的同时做些什么?
顺便说一句,我使用的是 C#,但问题似乎与语言无关。
【问题讨论】:
标签: c# cookies proxy web-crawler scraper