【发布时间】:2017-06-18 18:09:13
【问题描述】:
我正在使用solr.ICUTokenizerFactory 来索引我的firstName 和lastName 字段,以便我可以根据语言特定的单词边界对事物进行标记。
<fieldType name="text_icu" class="solr.TextField" positionIncrementGap="100">
<analyzer>
<tokenizer class="solr.ICUTokenizerFactory"/>
</analyzer>
</fieldType>
但是,我有一个我想弄清楚的用例。假设我的名字中有"steve-jobs" 之类的东西。
这被标记为两个标记。
史蒂夫,乔布斯
但是,如果我进行通配符搜索
史蒂夫乔*
它不会找到任何东西,因为没有这样的令牌。
如果我也可以保留原始令牌,我的问题将得到解决。 所以在以某种方式建立索引时,我可以生成三个这样的令牌
史蒂夫,乔布斯,史蒂夫乔布斯
有没有办法可以保留原始令牌?
我正在使用 DSE 4.8.12。
或者有没有其他方法可以解决这个问题。任何指针表示赞赏。谢谢。
【问题讨论】:
标签: elasticsearch solr lucene tokenize