【发布时间】:2018-10-30 21:08:49
【问题描述】:
我正在开发一个应用程序,该应用程序支持使用“solr”引擎对多语言文本(包括希伯来语)进行索引和搜索。
经过大量搜索,我发现 HebMorph 是用于希伯来语的最佳插件
我的问题是带有希伯来语停用词的 HebMorph 的行为似乎与 solr 不同:
使用 solr(任何语言):当我搜索停用词时,返回的结果不包括查询中存在的任何停用词。
而当我搜索希伯来语术语时(在this link 之后将 HebMorh 插入 solr 后,返回的结果包括查询中所有现有的停用词。
1) 这是 HebMorph 的正常行为吗?如果是,我该如何改变它?如果不是,我应该改变什么?
2) 由于 HebMorph 不支持同义词,(正如我在他们的文档中读到的那样,这是一项未来的工作)。有没有办法以 solr 支持的方式将希伯来语的同义词用作其他语言? (即通过在 solrconfig 中添加适当的过滤器并指出同义词文件)?
提前感谢您的帮助。
【问题讨论】:
-
请注意,您问题中的链接已损坏(链接 [1])
-
我不确定你的意思 - 停用词不会从 Solr 返回的内容中删除 - 存储的内容与提交的内容相同。停用词在标记化后被删除,并且只影响会产生命中的内容。据我所知,由于 HebMorph 中没有特定的停用词过滤器,因此您是否有任何来自 Solr 管理下的分析页面的示例可以显示您的问题?
-
@Jayce444:我试过了,效果很好。无论如何,这是网址:github.com/synhershko/HebMorph/blob/master/SOLR-README.md
-
@MatsLindh,感谢您的回复。内容应保持原样,我的意思是,如果您发送给 solr 的查询包含停用词(在希伯来语中),它将被视为应搜索的术语,而在 Solr 中,当您添加停用词过滤器时,论文不会在文档中搜索单词。无论如何,我都会尝试提供有关分析的快照。
-
@MatsLindh,在 Solr 的 Admin 下分析分析页面中的任何短语或术语时,应用的唯一过滤器 id [addSuffixTokenFilters] 由 HebMorph 的希伯来分析器使用.
标签: solr information-retrieval hebrew synonym stop-words