【发布时间】:2019-06-03 08:38:16
【问题描述】:
我有大约 200 万个文本可搜索的 PDF 文件。我需要能够在它们中搜索用户的查询并返回一个 sn-p 和一个文件名。前端是一个 Node.js React 应用程序。
现在我可以使用 pdfjs-dist (https://github.com/mozilla/pdfjs-dist) 将 PDF 内容读入 MySQL 数据库。然后使用全文 MATCH ... AGAINST 查询来搜索文本。但是,这很尴尬,而且 200 万份 PDF 真的很慢。此外,新文件会定期添加,因此将 PDF 读入 SQL 也是相当耗费资源的。
有没有更好的解决方案? Elasticsearch 是一个很好的解决方案吗?
该项目托管在 Google Cloud(App Engine 和 Cloud SQL)上。有没有谷歌工具可以做到这一点?
【问题讨论】:
标签: mysql node.js pdf elasticsearch google-cloud-platform