【发布时间】:2017-02-09 23:42:11
【问题描述】:
这是How to pass ElasticSearch query to hadoop 的后续问题。
基本上,我想在 ElasticSearch 中进行全文搜索,然后将结果集传递给 SQL 以运行聚合查询。这是一个例子:
假设我们在具有 10B 条记录的财务数据库中搜索“终结者”。它有以下匹配项:
- “终结者”(100 万条结果)
- “终结者 2”(1000 万条结果)
- “XJ4-227”(1 个结果 ==> 这里“终结者”在标题的概要中)
我们不会传回 10+M 个 ID,而是传回以下“简化查询”--
...WHERE name in ('Terminator', 'Terminator 2', 'XJ4-227')
我们如何编写这样的算法来将 ES 结果集缩减为可以发送回 SQL 的最小可能过滤查询? ES 是否有任何类型的匹配元数据可以帮助我们解决这个问题?
【问题讨论】:
标签: sql hadoop elasticsearch lucene