【问题标题】:How to develop a simple search engine for full text search in local files如何开发一个简单的搜索引擎在本地文件中进行全文搜索
【发布时间】:2014-05-15 07:59:18
【问题描述】:

谁能告诉我,我必须从哪里开始为本地文件开发一个简单的全文搜索引擎?

我有一个带 LAMP 的 Debian 7 服务器,并且我在上面安装了一个 Windows 网络驱动器。到目前为止,我正在使用this script 向其他本地网络用户显示目录树,他们可以在其中从挂载的网络驱动器下载文件。

但我必须构建一个简单的搜索引擎,它可以索引挂载文件夹中本地文件的名称和内容(如果有) - Microsoft doc、docx、xls、xlsx、rtf、txt。搜索必须返回文件的名称、路径,如果存在搜索词的部分文本(如果文件有文本),则最好返回。

有人可以指出我必须阅读和学习的正确方向吗?谢谢。

【问题讨论】:

    标签: apache solr lucene elasticsearch full-text-search


    【解决方案1】:

    为此,您需要几个工具。你需要一些东西来索引和搜索内容,并且你已经用三个很好的工具标记了这个问题,。每一个都包含丰富的教程和示例来帮助您入门。

    您需要的另一件事是读取所有这些不同文件类型的内容。我推荐Apache Tika。这是一个出色的工具包,可以读取您列出的所有格式,并且可以与 Lucene 配合使用。

    您可以在这个问题中看到它们一起使用的示例:Tika in Action book examples Lucene StandardAnalyzer does not work

    【讨论】:

    • 谢谢,我会查看文档。你有使用弹性搜索的经验吗?
    • 我只是想知道您是否代表您的经验对这些解决方案进行了一些比较。
    • Lucene 是一个搜索库,Solr 和 Elasticsearch 都是现成的搜索服务器,它们都是基于 Lucene 构建的。至于 Solr 和 Elasticsearch 之间的比较:不,对提供比较不感兴趣。它们都是优秀的产品。做一些研究,然后选择一个更适合你的。 The sematext blog provided an in-depth comparison,尽管在其间的一年半里,两者都处于非常积极的开发中,包括 ElasticSearch 的主要版本跳跃。
    【解决方案2】:

    你可能会觉得这很有帮助,你可能不会。

    我设置了 Solr 和 Nutch 来索引我的本地文件系统并将它们存储在 Solr 中,并提供了有关如何设置它们的指南。

    这将为您的应用程序提供可靠的后端。

    这里是链接。前两个用于 Solr 设置,后两个用于 Nutch 集成

    http://amac4.blogspot.co.uk/2013/07/setting-up-solr-with-apache-tomcat-be.html http://amac4.blogspot.co.uk/2013/07/setting-up-tika-extracting-request.html

    http://amac4.blogspot.co.uk/2013/07/configuring-nutch-to-crawl-urls.html http://amac4.blogspot.co.uk/2013/07/setting-up-nutch-to-crawl-filesystem.html

    【讨论】:

    • 谢谢,我会检查你的指南,即使它们是用于 Windows 设置的。
    • Linux 设置不能相差太大
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-01-31
    • 2011-05-16
    • 2015-05-17
    相关资源
    最近更新 更多