【发布时间】:2013-12-13 06:30:04
【问题描述】:
我是 nutch 的新手,所以我才刚刚开始。我想抓取一个特定的页面,在该页面下,我想抓取特定的链接。
例如
我只想爬http://nutch.apache.org/downloads.html
在这个页面下,我只想抓取 *.txt 链接。现在它们可以是像 这样的活动链接,或者它们可以嵌入到一些 div 中,就像我们在各种论坛中看到的那样文件上传/下载站点的链接被粘贴/嵌入在某些 div 等中,例如 http://example.com/movie_abcd/firstpart.avi
在这里,我只想抓取以 .avi 结尾的链接。我只是对 regex-urlfilter 感到困惑,因为到目前为止我只使用它,而且我不熟悉其他 url 过滤器,例如前缀和后缀 url 过滤器。他们也在我的问题的解决方案中发挥重要作用,如果他们这样做将是他们的目的。过去几天我在互联网上搜索适当的 nutch 教程,但找不到任何这样的。如何实现这一点。还有任何人都可以向我推荐一本关于 nutch ans solr 的好书,其中包含全面的实际工作示例以及关于它们及其方法的描述。
我会好奇地等待答案。
谢谢
【问题讨论】:
-
还没有人回答。请帮帮我。