【发布时间】:2010-07-11 18:33:28
【问题描述】:
我需要通过检查每个条目的预定义字符串的模糊匹配来过滤文本文章流(我正在搜索拼写错误的产品名称,有时它们具有不同的单词顺序和额外的非字母字符,例如“:”或“,” )。
通过将这篇文章放入 sphinx 索引并对其执行搜索,我得到了很好的结果,但不幸的是,我每秒收到数百篇文章,并且在获取每篇文章后更新索引太慢(我知道它不是为此类任务而设计的)。我需要一些库,它可以在大约 100kb 的小文本的内存索引中构建并对其执行模糊搜索,这样的东西存在吗?
【问题讨论】:
标签: python full-text-search fuzzy-search