【发布时间】:2018-03-21 10:04:39
【问题描述】:
我正在开发一个支持 Unicode 的全文搜索后端。
(数据库 PostgreSQL 9.5、PHP7、Ubuntu 17、Apache2)。
数据库正在正确地索引(使用 tsearch)相关的文本数据。到目前为止,一切都很好。
现在我需要使用用户提供的搜索词来搜索数据。我的第一个想法是使用explode(" ", $rawseachstring) 拆分搜索字符串,然后搜索单个单词,生成具有最佳匹配的结果集。
然而,Unicode 似乎定义了一大堆“类似空格”的字符,请参阅下一篇文章:
http://jkorpela.fi/chars/spaces.html
在尝试理解该页面(由 Unicode 大师 Korpela 编写)之后,我想知道将字符串拆分为 ' ' 是否有点幼稚。
是否应该对所有可能的“类似空格”字符进行拆分?
【问题讨论】:
标签: php unicode split full-text-search