【问题标题】:How to tokenize a sentence based on maximum number of words in Elasticsearch?如何根据 Elasticsearch 中的最大单词数对句子进行标记?
【发布时间】:2019-12-16 08:43:45
【问题描述】:

我有一个像“这是美好的一天”这样的字符串 我应该使用什么标记器或标记器和标记过滤器之间的什么组合来生成包含最多 2 个单词的术语的输出?理想情况下,输出应该是: “这,这,这,这,是,一个,一个,美好,美好,美好的一天,一天” 到目前为止,我已经尝试了所有内置的标记器,“模式”标记器似乎是我可以使用的,但我不知道如何为我的案例编写正则表达式模式。有什么帮助吗?

【问题讨论】:

标签: elasticsearch filter tokenize


【解决方案1】:

看来您正在寻找shingle token filter,它完全符合您的要求。

【讨论】:

    【解决方案2】:

    正如@Oleksii 所说。 在你的情况下 max_shingle_size = 2 (这是默认值)和 min_shingle_size = 1。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-04-03
      • 1970-01-01
      • 2019-10-16
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多