【问题标题】:Interface for SolrSolr 接口
【发布时间】:2012-06-14 13:00:11
【问题描述】:

我有大量要索引和查询的文档(主要是 PDF)。

我想按年将所有这些文档存储在一个文件系统结构中。

我目前在 Solr 中有此设置。但我必须运行脚本从 PDF 中提取元数据,然后更新索引。

有没有一种产品可以让我将一个新的 PDF 弹出到一个文件夹中并由 Solr 自动索引。

我已经看到 Alfresco 这样做了,但它有一些缺点 - 在这些方面还有什么其他的吗?

或者我会使用 nutch 来抓取我的文件系统并将更新发布到 Solr?我不确定我应该怎么做?

【问题讨论】:

    标签: solr


    【解决方案1】:

    Solr 是搜索服务器而不是爬虫。正如您所指出的,Nutch 可以做到这一点(我已经将它用于类似的用例,索引知识库转储)。

    基本上,您将托管一个以文件夹结构的根作为文档根的网络服务器。然后允许在此网络服务器上列出目录。然后 Nutch 可以抓取此文档转储的顶级 url。

    一旦你有了这个 Nutch 创建的索引,you can then expose it through solr 也是如此。

    【讨论】:

    • 谢谢。目前使用光圈来抓取 PDF 文档。我想我应该将其设置为 cron 以定期运行。然后只需在完成后更新 SOLR 实例。我使用 Nutch 有什么令人信服的理由吗?
    • 我没用过Aperture,所以不能评论。我还需要提供 PDF,因此将 URL 返回到文件系统上的 PDF 是有意义的,因此需要一个全功能的爬虫,例如 Nutch。另外,[PDF 可以直接添加到 Solr] (wiki.apache.org/solr/ExtractingRequestHandler)。
    猜你喜欢
    • 2010-12-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-04-16
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多