【发布时间】:2014-08-28 20:30:33
【问题描述】:
我们在进行 Nutch 爬网时遇到了一个奇怪的情况,其中 Nutch 有时会到达一个错误的网页,实际上,服务器应该为此发送 404。无论出于何种原因,服务器都没有发送。
当 Nutch 遇到这个“错误”的 URL 时,会生成一个页面,其中包含基于错误的所有相对路径。因此,如果根页面是“http://example.com/bad”,则该页面将包含数百个链接,例如“example.com/bad/data/1”和“example.com/bad/calendar/2012”和“example.com/bad/calendar/2012”。 com/bad/data/1/calendar/2012"。
因此,Nutch 将永远爬行。
我想追溯错误地首先链接到这个“坏”页面的任何页面。似乎这应该可以使用bin/nutch readlinkdb 或bin/nutch readdb 命令来实现。我尝试指定一个错误 url(通过'--url'),每个都没有找到相关的 URL。进行完整转储实际上确实是不包含任何错误 URL 的净数据。但 Nutch 确实会向 Solr 注入错误的 URL。
为什么会这样,我如何追踪 Nutch 到错误 URL 的路径?
【问题讨论】:
标签: solr web-crawler nutch