【发布时间】:2012-10-19 15:48:29
【问题描述】:
我正在使用 Rapid Miner 从特定数据中抓取网站。问题是如果我尝试经常抓取网站,它会提供错误的数据。
如果我从其他 IP 地址看到相同的数据,它显示的数据与我在不同 IP 地址上抓取的数据不同。
有没有办法解决这个问题?
【问题讨论】:
-
“不良数据”和“与 [...] 相比的不同数据”是什么意思?我不知道你的问题是什么。请提供一个过程和问题的确切描述!
我正在使用 Rapid Miner 从特定数据中抓取网站。问题是如果我尝试经常抓取网站,它会提供错误的数据。
如果我从其他 IP 地址看到相同的数据,它显示的数据与我在不同 IP 地址上抓取的数据不同。
有没有办法解决这个问题?
【问题讨论】:
今天的许多网站,尤其是值得挖掘(即:链接)的网站都使用复杂的方法来检测和阻止除少数与他们达成协议的大型搜索引擎之外的所有网站的抓取。
尝试改变您发送的浏览器代码,并将抓取分布在一组机器而不是单台机器之间。在 AWS 上运行一堆微型实例比一个大型实例更可取。还要确保在请求之间设置延迟,因为这既考虑周到,又有助于伪装你的爬虫。
【讨论】: