【问题标题】:Searching through PDF text and returning a snippet with Node.js使用 Node.js 搜索 PDF 文本并返回一个片段
【发布时间】:2019-06-03 08:38:16
【问题描述】:

我有大约 200 万个文本可搜索的 PDF 文件。我需要能够在它们中搜索用户的查询并返回一个 sn-p 和一个文件名。前端是一个 Node.js React 应用程序。

现在我可以使用 pdfjs-dist (https://github.com/mozilla/pdfjs-dist) 将 PDF 内容读入 MySQL 数据库。然后使用全文 MATCH ... AGAINST 查询来搜索文本。但是,这很尴尬,而且 200 万份 PDF 真的很慢。此外,新文件会定期添加,因此将 PDF 读入 SQL 也是相当耗费资源的。

有没有更好的解决方案? Elasticsearch 是一个很好的解决方案吗?

该项目托管在 Google Cloud(App Engine 和 Cloud SQL)上。有没有谷歌工具可以做到这一点?

【问题讨论】:

    标签: mysql node.js pdf elasticsearch google-cloud-platform


    【解决方案1】:

    是的,我想说 Elasticsearch 是一个很棒的工具,可以索引 PDF 并在以后搜索它。

    有一个ingest attachment processor plugin 允许从常见格式(PDF、TXT、DOC 等)中提取数据并将其索引到 Elasticsearch 中,以便以后进行搜索。

    Google Cloud 有 Elasticsearch cluster plugin,这应该会使集成更容易。还有一个Elasticsearch service in the Google Cloud 有大量的支持。

    【讨论】:

    • 你能解释一下集群插件和服务的区别吗?
    猜你喜欢
    • 2019-01-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-11-18
    • 2019-05-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多