【问题标题】:Indexing engine索引引擎
【发布时间】:2011-08-26 02:02:50
【问题描述】:

我正在开发上下文发现系统——它结合了搜索和建议。
目前我正在寻找用于索引的库。
经过一番调查,我继续使用 LuceneTerrier,发现 Indri 不舒服。

两者都有什么缺点?我在使用时会遇到什么问题?

Terrier 是否真的没有增量索引(每次添加新文档时,我都需要重新构建和重新索引所有内容)?

我的要求是: - 轻松添加新文档 - 简单的评分方法注入 - 安静的定义良好的模型

还有一件事:梗犬还活跃吗?自 2010 年 10 月 3 日以来,我没有看到任何更新 terrier changelog

【问题讨论】:

  • 您将如何访问索引?直接使用 java 或使用类似代理的东西(例如 Solr 和 lucene)?因为 Solr 提供了改进 lucene 的特性(例如高程特性)
  • 我想用java编程,所以可以直接访问。

标签: indexing lucene search-engine information-retrieval


【解决方案1】:

您将使用哪种类型的数据库?以我的经验,Lucene 比 Terrier 的文档记录要好得多。

这是一篇比较 Lucene 和 Terrier 的文章:

http://text-analytics.blogspot.com/2011/05/java-based-retrieval-toolkits.html

【讨论】:

  • 嗨,我以前看过这篇文章。关于增量索引的问题来自这篇文章。我认为数据库不是重点,因为两者都支持新的优秀数据库(lucandra 和 hdoop -> 可扩展性)。
猜你喜欢
  • 2020-08-11
  • 2023-03-21
  • 1970-01-01
  • 1970-01-01
  • 2010-11-16
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多