【问题标题】:Crawl and Index specific links on specific page在特定页面上抓取和索引特定链接
【发布时间】:2013-12-13 06:30:04
【问题描述】:

我是 nutch 的新手,所以我才刚刚开始。我想抓取一个特定的页面,在该页面下,我想抓取特定的链接。

例如

我只想爬http://nutch.apache.org/downloads.html

在这个页面下,我只想抓取 *.txt 链接。现在它们可以是像 这样的活动链接,或者它们可以嵌入到一些 div 中,就像我们在各种论坛中看到的那样文件上传/下载站点的链接被粘贴/嵌入在某些 div 等中,例如 http://example.com/movie_abcd/firstpart.avi

在这里,我只想抓取以 .avi 结尾的链接。我只是对 regex-urlfilter 感到困惑,因为到目前为止我只使用它,而且我不熟悉其他 url 过滤器,例如前缀和后缀 url 过滤器。他们也在我的问题的解决方案中发挥重要作用,如果他们这样做将是他们的目的。过去几天我在互联网上搜索适当的 nutch 教程,但找不到任何这样的。如何实现这一点。还有任何人都可以向我推荐一本关于 nutch ans solr 的好书,其中包含全面的实际工作示例以及关于它们及其方法的描述。

我会好奇地等待答案。

谢谢

【问题讨论】:

  • 还没有人回答。请帮帮我。

标签: regex url solr nutch


【解决方案1】:

查看我的帖子,如果您有任何问题,请在底部评论,我会尽力帮助您。

Solr Tutorial

Nutch Tutorial

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2017-09-04
    • 2018-09-25
    • 1970-01-01
    • 1970-01-01
    • 2015-09-01
    • 2018-05-08
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多