【发布时间】:2019-05-03 23:33:57
【问题描述】:
我是 ElasticSearch 的新手,我正在探索它是否是满足我需求的可行解决方案,我将在下面解释。非常感谢专家的任何指导。
我有大量的文本数据,涉及数亿个文档。我想识别这些文件的子集(可能是数千到数十万),其中包含这些文件中的特定关键字(例如药物名称),并添加自定义标签以与结果集相关联。例如,假设有 100K 个文件被标识为“drug-A-for-Diabetes”,应该与标签“drug-A”相关联。 ES 是解决这个问题的正确方法吗?我知道 ES 具有高度可扩展性,但对于这样的工作流程,可扩展性是否值得关注?我正在探索一些替代方案,并且鉴于时间限制,希望在深入研究之前获得一些指导(我仍在阅读文档以更好地理解 Elastic Stack)。将不胜感激任何能将我们带向正确方向的指导/指针。
【问题讨论】:
-
如果您设法找到一个查询来识别与“用于糖尿病的药物 A”相关的所有文档,那么您可以轻松地将它们标记为“药物 A”。标记只是文档中的另一个字段,然后您可以在其上运行术语过滤器,以选择所有有关“糖尿病药物 A”的文档并执行其他类型的聚合等。您的用例并非 100% 清楚我,但据我所知,是的,ES 支持这一点。它是否适合您的确切需求(当前和未来),不进一步深入了解。
-
@Val 非常感谢您的指点。我将查看过滤器和聚合以了解更多信息。
标签: elasticsearch