【发布时间】:2012-10-07 17:11:44
【问题描述】:
我们试图找出项目(和后来的用户)之间的相似性,其中项目按用户在各种列表中排名(想想Hi Fidelity 中的 Rob、Barry 和 Dick)。给定列表中较低的索引意味着较高的评级。
我认为标准方法是使用 Pearson 相关性,然后以某种方式反转索引。
但是,据我了解,Pearson 相关性的目的是补偿通常对事物评分较高或较低但相对评分相似的用户之间的差异。
在我看来,如果列表是连续的(尽管长度是任意的),那么从该位置隐含的评级就会以这种方式出现偏差,这不是问题。
我想在这种情况下,基于欧几里得的相似性就足够了。是这样吗?使用 Pearson 相关性会产生负面影响并找到不合适的相关性吗?哪种相似性度量可能最适合此数据?
此外,虽然我们希望列表中的位置有效,但我们不想惩罚相差太远的排名。两个用户都在一个列表中展示了一个排名非常不同的项目,仍然应该被认为是相似的。
【问题讨论】:
标签: mahout recommendation-engine collaborative-filtering