【问题标题】:Nutch - Crawler not following next pages in paginated contentNutch - 爬虫不跟随分页内容中的下一页
【发布时间】:2013-05-23 17:36:23
【问题描述】:

我正在使用 nutch 1.6 抓取包含 20 个产品/页面的分页网页,使用以下命令:

./nutch crawl urls -dir <dir> -depth 4 -topN 100 -threads 100

我收到了 20 款首批产品以及指向以下页面的链接。但是爬虫没有关注我的下一页链接?我是否缺少参数?

【问题讨论】:

  • 分页链接是直接超链接吗?还是 AJax 或者其他形式?
  • 它们只是 a html 标签,而不是 Ajax 链接。

标签: solr web-crawler nutch


【解决方案1】:

不幸的是,Nutch 1.6 不支持爬取基于 Ajax 的网站。请参阅 thisthis。没有立即添加相同内容的计划。

【讨论】:

  • 我知道 Nutch 不支持 Ajax。但是,分页不是用 Ajax 制作的。也许我正在启动的命令不正确。这是我试图抓取的网址(urls/seed.txt):Ouedkniss
【解决方案2】:

regex-urlfilter 阻止具有查询字符串参数的 url:

# 跳过包含某些字符的 URL 作为可能的查询等。

-[?*!@=]

修改该文件,以便抓取带有查询字符串参数的网址:

# 跳过包含某些字符的 URL 作为可能的查询等。

-[*!@]

【讨论】:

  • 元标签是否允许抓取,即它们是否被 robots.txt 或页面上的 标签阻止? 标签是否有 rel=nofollow 或 noindex?
  • <a> 标签中没有rel=nofollow<meta> 机器人的标签有一个index, follow 内容属性,我不认为它被文本文件阻止。也许问题出在我正在输入的命令中?
  • 您的命令将抓取四级深度的页面,每级最多 100 个页面。也许您可以尝试增加这些限制以查看您的网页是否被抓取。
  • 我明白这一点。我认为我需要增加深度。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-04-09
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多