【问题标题】:Empty Nutch crawl list空 Nutch 爬网列表
【发布时间】:2010-12-18 19:51:28
【问题描述】:

我正在尝试在 Eclipse 中使用 Nutch 进行爬网。

我正在使用一个名为 urls 的文件,它包含

http://www.google.com/

但是,当我运行项目时,生成器类告诉我:

“选择 0 条记录进行提取,退出”

我该如何解决这个问题?

我已遵循这些文档:

http://wiki.apache.org/nutch/RunNutchInEclipse1.0

http://wiki.apache.org/nutch/NutchTutorial

任何帮助将不胜感激。

【问题讨论】:

    标签: java eclipse nutch


    【解决方案1】:

    我最近遇到了这个问题,发现大多数回复都与 (regex|crawl)-urlfiters.txt 有关。要检查的另一件事是您的“-topN”设置。这需要足够大,以便生成器通过所有过滤器。

    我希望这会有所帮助。

    【讨论】:

      【解决方案2】:

      它很可能是您的 regex-urlfilter.xml。试试用这个看看能不能解决问题

      -^(file|ftp|mailto):

      -.(gif|GIF|jpg|JPG|png|PNG|ico|js|ICO|doc|mp3|MP3|DOC|css|rss|sit|eps|wmf|zip|ppt|mpg|xls| gz|rpm|tgz|mov|MOV|exe|jpeg|JPEG|bmp|BMP)$

      -.*(/[^/]+)/[^/]+\1/[^/]+\1/

      +。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2012-02-27
        • 1970-01-01
        • 2011-05-15
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多