【发布时间】:2017-03-06 21:54:08
【问题描述】:
给定一个查询列表和一个文档,我想根据查询与给定文档的相关程度对它们进行排名。
对于每个查询,我计算了查询中每个单词的词频。 (词频定义为单词在文档中出现的次数除以文档中的总单词数)
现在,我总结了查询中每个词的词频。
例如:
search query: "Hello World"
document: "It is a beautiful world"
tf for 'Hello': 0
tf for 'World': 1/5 = 0.2
total tf for query 'Hello World' = 0 + 0.2 = 0.2
我的问题是,将每个查询的词频标准化的最佳方法是什么?这样长查询不会导致更大的相关性分数。
而且,有没有比仅使用 tf 分数更好的方法来对查询进行评分?
我不能在我的场景中使用 tf-idf,因为我只针对一个文档对它们进行排名。
【问题讨论】: