【发布时间】:2014-04-15 04:24:26
【问题描述】:
任何人都可以就如何正确配置 apache nutch 提供指导,以便在爬取网站时获取数据库中的一些记录。我将不胜感激!
这里的详细信息:
我的bin/urls/seed.txt 文件中有以下行:
http://transmetod.ru/
以下是 regex-urlfilter.txt 文件中的行(所有其他正则表达式都已注释):
+^http://([a-z0-9]*\.)*transmetod.ru/([a-z0-9]*\.)*
基本上,我希望数据库中的许多记录会因爬行而出现,但唯一得到的只有一条带有基本 url 的记录(没有任何其他记录在 url 中有额外的子链接)
这是我用来运行 apache-nutch-2.1 项目的命令行:
./nutch crawl urls -depth 3 -topN 10000
谁能指出我犯的错误或给我一些建议?
P.S.:基本上,当我构建项目并在没有任何更改的情况下运行它时,我也没有得到一堆记录......(如果我没记错的话)
【问题讨论】:
标签: database web-crawler nutch