【问题标题】:Nutch web spider, index entire webNutch 网络蜘蛛,索引整个网络
【发布时间】:2011-03-16 01:39:29
【问题描述】:

好的,我一直在搞乱Nutch,需要知道我编辑的crawl-urlfilter.txt 文件中的什么参数,这样蜘蛛就没有边界。换句话说,我希望它在指定域之外的网络上漫游。

我假设它与这一行有关,但我不知道如何正确编辑它以按照我的意愿进行操作:

+^http://([a-z0-9]*\.)*urlz.net/

【问题讨论】:

  • 它似乎与域urlz.net 下的url 匹配。尝试改用+^http://([a-z0-9]*\.)*

标签: regex nutch


【解决方案1】:

我对 Nutch 不熟悉,但这只是一个正则表达式。

+^http://([a-z0-9\.])*

可能会工作得很好,或者它的一些变化。它只是匹配一个模式。我刚刚在上面写的那个应该匹配以 http:// 开头的任何内容,然后是任意数量的字母、数字或点。

【讨论】:

  • 应该,我在阅读 Oscar 的帖子后修复了它,所以答案中的那个应该很好。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-07-10
  • 1970-01-01
  • 1970-01-01
  • 2017-08-30
  • 1970-01-01
相关资源
最近更新 更多