【问题标题】:apache nutch does not add sublinks to main siteapache nutch 不向主站点添加子链接
【发布时间】:2014-04-15 04:24:26
【问题描述】:

任何人都可以就如何正确配置 apache nutch 提供指导,以便在爬取网站时获取数据库中的一些记录。我将不胜感激!

这里的详细信息:

我的bin/urls/seed.txt 文件中有以下行:

http://transmetod.ru/

以下是 regex-urlfilter.txt 文件中的行(所有其他正则表达式都已注释):

+^http://([a-z0-9]*\.)*transmetod.ru/([a-z0-9]*\.)*

基本上,我希望数据库中的许多记录会因爬行而出现,但唯一得到的只有一条带有基本 url 的记录(没有任何其他记录在 url 中有额外的子链接)

这是我用来运行 apache-nutch-2.1 项目的命令行:

./nutch crawl urls -depth 3 -topN 10000

谁能指出我犯的错误或给我一些建议?

P.S.:基本上,当我构建项目并在没有任何更改的情况下运行它时,我也没有得到一堆记录......(如果我没记错的话)

【问题讨论】:

    标签: database web-crawler nutch


    【解决方案1】:

    尝试将您的正则表达式过滤器更改为:

    +^http://([a-z0-9]*.)transmetod.ru/
    

    此外,当您第一次运行 Nutch 时,它会抓取您放入种子文件的网址。 下次运行爬取时,使用相同的爬取文件夹,它应该会拾取第一页的外链并进行爬取。

    【讨论】:

    • 非常感谢,我们会尝试并获得有关它是否有帮助的反馈!
    猜你喜欢
    • 1970-01-01
    • 2023-03-13
    • 1970-01-01
    • 2012-08-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多