【发布时间】:2023-04-09 01:33:01
【问题描述】:
我们需要每两周抓取大量(约 15 亿)网页。速度和成本对我们来说是一个重要因素,因为我们最初的尝试最终花费了超过 2 万美元。
有没有关于哪个爬虫在分布式环境中表现最好的数据?
【问题讨论】:
标签: web-crawler nutch heritrix stormcrawler
我们需要每两周抓取大量(约 15 亿)网页。速度和成本对我们来说是一个重要因素,因为我们最初的尝试最终花费了超过 2 万美元。
有没有关于哪个爬虫在分布式环境中表现最好的数据?
【问题讨论】:
标签: web-crawler nutch heritrix stormcrawler
我们只尝试过 nutch、stormcrawler 和 mixnode。我们最终使用 mixnode 在 5k 个域中抓取了大约 3 亿个页面。
我的 0.02 美元:mixnode 是更大规模抓取(也就是超过 100 万个 url)的更好选择。对于较小的爬网,这是一种过大的杀伤力,因为您必须解析生成的warc文件,如果您只做几千页,那么运行自己的脚本或使用开源替代品(如nutch或stormcrawler(甚至是scrapy)会更容易) .
Mixnode 现在是 an "alternative" to web crawling,所以它与我的旧答案完全不同。
【讨论】:
有关 Nutch 和 StormCrawler 之间的比较,请参阅 my article on dzone。
Heritrix 可以在分布式模式下使用,但文档对如何执行此操作不是很清楚。前 2 个依赖于完善的平台来分配计算(分别为 Apache Hadoop 和 Apache Storm),但 Heritrix 并非如此。
Heritrix 也主要由归档社区使用,而 Nutch 和 StormCrawler 用于更广泛的用例(例如索引、抓取)并有更多资源用于提取数据。
我不熟悉您提到的 2 个托管服务,因为我只使用开源软件。
【讨论】: