【发布时间】:2016-01-04 08:54:45
【问题描述】:
我使用 BFS 创建了一个简单的网络爬虫,给定一些种子 URL 和一些关键字,它会在网络上爬取使用这些关键字搜索内容。我相信下一步是索引以便搜索引擎可以查询它,我想知道最好的方法是什么?我最担心的一些问题是:
我应该将索引存储在文件还是数据库中?
我是存储找到的页面以及该页面的所有传出地址还是仅存储未访问的地址?
【问题讨论】:
标签: java search web-crawler search-engine
我使用 BFS 创建了一个简单的网络爬虫,给定一些种子 URL 和一些关键字,它会在网络上爬取使用这些关键字搜索内容。我相信下一步是索引以便搜索引擎可以查询它,我想知道最好的方法是什么?我最担心的一些问题是:
我应该将索引存储在文件还是数据库中?
我是存储找到的页面以及该页面的所有传出地址还是仅存储未访问的地址?
【问题讨论】:
标签: java search web-crawler search-engine
我建议使用 Lucene。它是索引和搜索性能的标准。 Check it out here。 Lucene 默认将索引信息存储到磁盘。你也可以store it in a database as well。
【讨论】: