【发布时间】:2017-05-22 17:48:18
【问题描述】:
我最近才发现 Storm 爬虫,根据过去的经验和研究以及与不同爬虫的合作,我发现这个基于 Apache Storm 的项目非常强大,适用于许多用例和场景。
我已经阅读了一些教程并使用一些基本设置测试了风暴爬虫。我想在我的项目中使用爬虫,但有些事情我不确定爬虫是否能够做,或者它是否适合此类用例。
我想在具有特定速度设置并限制获取的 url 数量的许多网络域上进行小型和大型递归爬网。可以随时使用不同的设置(不同的速度、忽略该域的 robots.txt、忽略外部链接)单独启动爬网。
问题:
- 风暴爬虫适合这种场景吗?
- 能否将限制设置为 爬虫?
- 我可以为不同的页面设置获取页数的限制吗? 域?
- 我可以单独监控特定域的抓取进度吗?
- 我可以动态设置设置而不需要将修改后的拓扑上传到storm吗?
- 是否可以暂停或停止抓取(针对特定域)?
- storm crawler 通常作为一个部署的拓扑运行吗?
我认为其中一些问题的答案可能是自定义或编写我自己的螺栓或喷嘴。但我宁愿避免修改 Fetcher Bolt 或爬虫的主要逻辑,因为这意味着我正在开发另一个爬虫。
谢谢。
【问题讨论】:
标签: java web-crawler apache-storm stormcrawler