【发布时间】:2012-04-06 07:30:37
【问题描述】:
我已经有一个使用 Lucene3.5 的项目了。
现在我需要提供网络搜索功能,但我不想导入整个 Nutch 项目。
所以我想知道,可能我只能使用 Nutch 的爬虫部分来爬取网站并将它们索引到 Lucene 样式中。
然后使用我现有的 Lucene 搜索器搜索索引文件。
是否可以这样做或者您有什么建议(Heritrix 怎么样)?
【问题讨论】:
标签: java lucene web-crawler nutch heritrix