【发布时间】:2015-03-04 09:23:08
【问题描述】:
在 Solr 4.* 中,假设我有字段 "mytext"。
“
mytext”中的第一条记录是“working at ABC”。“
mytext”中的第二条记录是“working at ABC project ABC”。
现在当我搜索“Working at ABC”时,文档序列是
文档 1:“Working at ABC project ABC”
文档 2:“Working at ABC”
虽然根据计算它是有意义的,但第二个文档应该在顶部,因为它包含两次“ABC”(第二个文档的 TF 更高)。
但从用户的角度来看,当查询输入“在 ABC 工作”时,结果应该是
"Working at ABC"
"Working at ABC project ABC"
.
我该如何处理这种情况。 仅当“公司”和“项目”有重叠数据时才会出现此项目。就像在这种情况下它的“ABC”。
谢谢
阿米特·阿加瓦尔
【问题讨论】:
-
你必须问自己为什么doc2应该有更高的排名?它对用户更有意义,但为什么呢?否则你会一直循环下去,在另一种情况下你会遇到相反的情况。
-
你总是可以覆盖模式文件中的相似性类,并提供你自己的实现来计算TF、IDF、范数等。我通常在有奇怪情况时这样做。
标签: solr lucene lucene.net solr4