【发布时间】:2013-02-20 10:31:33
【问题描述】:
是否有一个 Lucene 分析器可以用它们的短名称等价物(例如 Mike 和 Michael、Rich 和 Richard、Suzie 和 Susan)等对名称部分进行标记?
Levenshtein 距离上的模糊匹配是我知道的一种解决方案,一些实现者似乎将模糊匹配与 soundex 算法配对。肯定有人轻描淡写地在某处简单地列出所有这些短名称?
编辑:这个问题最难的部分是从哪里获取同义词数据?
【问题讨论】:
-
美国人口普查局在他们的网站上提供了一些关于英文名称的信息(但不能保证他们有这些信息,而且需要一些谷歌搜索才能找到)。
-
这有一些想法,但名字很不常见:answers.google.com/answers/threadview/id/778986.html
标签: search solr lucene elasticsearch