【发布时间】:2011-10-16 13:41:47
【问题描述】:
在布尔检索模型中,查询由使用不同运算符组合在一起的术语组成。乍一看,连词是最明显的选择,但是当查询长度增长时,就会发生不好的事情。使用连词时召回率显着下降,而使用析取时精度下降(例如,stanford OR university)。
至于现在我们使用连词是我们的搜索系统(和布尔检索模型)。如果用户输入一些非常罕见的单词或长序列的单词,我们就会遇到问题。例如,如果用户输入toyota corolla 4wd automatic 1995,我们可能没有。但是,如果我们从查询中删除至少一个单词,我们就有这样的文档。据我在向量空间模型中了解,这个问题自动解决了。我们不会根据术语存在的事实过滤文档,我们使用术语的存在对文档进行排名。
所以我对布尔检索模型中更高级的组合术语以及布尔检索模型中罕见术语消除的方法感兴趣。
【问题讨论】:
标签: theory information-retrieval