【问题标题】:How to go about indexing 300,000 text files for search?如何索引 300,000 个文本文件进行搜索?
【发布时间】:2011-06-01 05:33:09
【问题描述】:

我有超过 300,000 个文本和 html 文件的静态集合。我希望能够在它们中搜索单词、确切的短语和理想的正则表达式模式。我希望搜索速度快。

我认为可以通过查找包含每个单词的文件的唯一单词字典来搜索单词和短语,但是有没有办法进行相当快速的正则表达式匹配?

如果存在的话,我不介意使用现有软件。

【问题讨论】:

  • 不介意使用现有软件?严重的是,这个问题太复杂,一个人无法及时实施。这不属于这里。
  • 是的,可以进行快速正则表达式搜索,正如google.com/codesearch 所展示的那样。但我不知道他们是怎么做到的。

标签: database search


【解决方案1】:

【讨论】:

【解决方案2】:

市场上有很多可以帮助你实现你想要的东西,有些是开源的,有些是定价的:

开源:

elasticsearch - 基于 lucene

constellio - 基于 lucene

Sphinx - 基于 C++

Solr - 建立在 lucene 之上

【讨论】:

    【解决方案3】:

    【讨论】:

    • Microsoft Search Server 是否支持使用正则表达式进行搜索?
    • 我很确定这是可能的,但我不是这方面的专家。
    【解决方案4】:
    猜你喜欢
    • 2010-10-25
    • 2014-05-15
    • 1970-01-01
    • 2012-04-18
    • 1970-01-01
    • 1970-01-01
    • 2016-06-09
    • 2014-06-22
    • 2018-09-27
    相关资源
    最近更新 更多