【发布时间】:2018-03-28 11:03:39
【问题描述】:
我已经为 apache Nutch 2.3.1 配置了完整的 Hadoop/Hbase 生态系统。我希望我的爬虫应该更多地优先考虑在每次迭代中以种子形式给出的那些域。根据我的测试;它可以在任一方向完成,即从外链接中选择所有网址,反之亦然。可以说,我希望 40% 的选定 URL 应该来自外链(种子中给出的除外),并且 60% 的 URL 应该属于种子中给出的域。有可能吗?怎么做?
我认为是生成器步骤导致了这种行为。
【问题讨论】:
标签: web-crawler nutch giraph nutch2