【问题标题】:Is it possible to integrate Nutch Crawler with my existing Lucene project?是否可以将 Nutch Crawler 与我现有的 Lucene 项目集成?
【发布时间】:2012-04-06 07:30:37
【问题描述】:

我已经有一个使用 Lucene3.5 的项目了。

现在我需要提供网络搜索功能,但我不想导入整个 Nutch 项目。

所以我想知道,可能我只能使用 Nutch 的爬虫部分来爬取网站并将它们索引到 Lucene 样式中。

然后使用我现有的 Lucene 搜索器搜索索引文件。

是否可以这样做或者您有什么建议(Heritrix 怎么样)?

【问题讨论】:

    标签: java lucene web-crawler nutch heritrix


    【解决方案1】:

    是的,可以使用您自己的 lucene 实现来搜索 nutch 生成的索引。我在我们项目的 wiki 中写了一个简短的描述,我们使用 nutch 抓取静态内容。

    您可以在这里查看:http://code.google.com/p/gtxcontentconnector/wiki/HowTo_Nutch

    br, 克里斯

    【讨论】:

    • 感谢 csupnig,但我注意到 Lucene 索引文件似乎与 Nutch 索引文件不同。Lucene 索引是“.fdt”、“.fdx”等。但是 Nutch 出来的是“part-0000/data、part-0000/index”。
    • 爬取完成后,索引应该在 nutch_base_dir/your_crawl_dir/index.据我记得,part-xxxx部分最后会合并。
    猜你喜欢
    • 1970-01-01
    • 2011-12-07
    • 2010-10-31
    • 1970-01-01
    • 2015-10-23
    • 2015-11-22
    • 2023-03-12
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多