【问题标题】:Ranking items by score and relative frequencies按分数和相对频率对项目进行排名
【发布时间】:2014-10-09 07:38:09
【问题描述】:

我想通过比较篮子 1 中的频率与另一个篮子 2 中的频率的比率来对项目类型进行排名。

例如,如果 A 类物品在篮子 1 中有大约 5 个计数,在篮子 2 中有 0 个计数,那么这应该比 B 类物品的排名高得多,比如在篮子 1 中有 10 个物品,在篮子 2 中有 10 个物品。我使用赔率比率abs(log(freq in basket1/freq in basket2)),但是这并没有捕捉到我应该优先考虑abs(log(10/100))abs(log(1/10)) 的事实。

我正在考虑是否将此结果乘以它们的总计数,例如(10+100)abs(log(10/100)),但这个数量似乎又压倒了日志值。

衡量日志值的好建议是什么?

【问题讨论】:

  • 频率差异会给我一些价值。对这些值进行排序应该可以解决您的问题吗?排序后的列表将为您提供排名。
  • @pala,不是真的。假设我有 [1,2]、[100,101],但它们的含义并不相同。
  • 在您的问题中 typeA 的排名高于 typeB。如何? [1,2] 和 [100,101] 有什么区别?

标签: algorithm ranking


【解决方案1】:

这类任务的标准方法是将物品建模为产生篮子的有偏硬币,B1 的概率为p,B2 的概率为1 - p。直观地说,这意味着一个项目类型具有一个潜在的篮子真实比率,这会在篮子之间产生特定的项目拆分。因此,“90% A”可能会产生 [9,1],但也会产生 [10,0] 甚至 [0,10],尽管这种结果的概率非常低。

然后您可以查看 [5,0] 和 [10,1] 之类的样本并计算参数 p 的置信区间,然后按区间的下限对项目类型进行排名。这样 [10,2] 将排在 [5,1] 之上。即使两个样本中的比例相同,[10,2] 的置信区间也会更窄,因此其下限会更高。

这个想法和一些更详细的公式描述在:http://www.evanmiller.org/how-not-to-sort-by-average-rating.html

【讨论】:

    猜你喜欢
    • 2021-07-28
    • 2020-02-06
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-01-20
    • 2020-10-19
    • 1970-01-01
    相关资源
    最近更新 更多