【问题标题】:Basic search engine - after crawling what's next?基本搜索引擎 - 抓取后下一步是什么?
【发布时间】:2016-01-04 08:54:45
【问题描述】:

我使用 BFS 创建了一个简单的网络爬虫,给定一些种子 URL 和一些关键字,它会在网络上爬取使用这些关键字搜索内容。我相信下一步是索引以便搜索引擎可以查询它,我想知道最好的方法是什么?我最担心的一些问题是:

我应该将索引存储在文件还是数据库中?

我是存储找到的页面以及该页面的所有传出地址还是仅存储未访问的地址?

【问题讨论】:

    标签: java search web-crawler search-engine


    【解决方案1】:

    我建议使用 Lucene。它是索引和搜索性能的标准。 Check it out here。 Lucene 默认将索引信息存储到磁盘。你也可以store it in a database as well

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-01-22
      • 2012-06-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多