【发布时间】:2016-07-25 17:25:25
【问题描述】:
我阅读了有关如何计算相关性分数的文档。但我仍然无法理解为什么他们考虑了逆文档频率。逆文档频率如何影响文档的相关性?
【问题讨论】:
标签: elasticsearch
我阅读了有关如何计算相关性分数的文档。但我仍然无法理解为什么他们考虑了逆文档频率。逆文档频率如何影响文档的相关性?
【问题讨论】:
标签: elasticsearch
基本上,如果一个术语 T 非常常见(例如停用词、“and”、“the”等)并且可以在您的大量文档中找到,那么您可能对恢复所有文档不感兴趣并且您可能不希望 T 一词对评分影响太大。
这是 TF/IDF 公式中 IDF 部分的工作,这意味着稀有词对分数的贡献更高,因此为什么给定文档中词 T 的词频 TF 乘以 IDF整个文档语料库的那个术语。很明显,包含给定术语的文档越多,该术语的相关性/区别性就越低。
一个术语“大象”在文档 D 中出现了几次,但不一定在所有其他文档中出现,这将有助于为文档 D 提供比所有其他文档更高的分数。
几乎所有文档中出现的术语“and”对分数的贡献不大,因为 IDF 可以忽略不计。
【讨论】: