【问题标题】:Expiring Page Rank algorithm过期页面排名算法
【发布时间】:2011-09-21 08:39:10
【问题描述】:

我正在寻找一种算法,它可以进行某种页面排名,但随着时间的推移,页面的价值会降低。

我见过的所有算法都相反(赋予旧域更多价值)。

非常感谢帮助找到这样的算法。

编辑: 看着我最初的问题,我想我有点不清楚我在问什么,而且这个问题比我最初想象的要复杂。 基本上我想要的是某种排名算法,如果站点 A 在站点 B 发表帖子后立即链接到站点 B,那么站点 B 的页面会获得额外的页面排名(也许分数是一个更好的词),但是如果站点 A 有发布后很长时间链接到站点 B,它对页面排名的增加很少。

希望这是有道理的。对于最初的问题是错误的,我们深表歉意。

【问题讨论】:

  • 最好提供您尝试过的算法,但您不能将其从最旧日期更改为最新日期。
  • @SaeedAmiri:OP 明确提到了他正在使用的算法:pagerank。这个问题很清楚,对于任何熟悉这个算法的人来说都是众所周知的。
  • @amit,我知道 pagerank 但它有一些变化,并且 OP 没有提到为什么他不能使用它(有一个小的变化)来使用最新的帖子。
  • @amit,正如我在您的回答中看到 OP 的评论,他似乎不熟悉算法,所以最好让他向我们展示他的尝试,然后尝试使用我们的帮助。
  • 我不必使用 Page Rank,但这是我目前在进行一系列调查的地方。我很高兴有任何其他建议。

标签: algorithm pagerank


【解决方案1】:

您可以使用 有偏见的页面排名,正如 Haveliwala 在此 article 中所述。

思路很简单,不使用常规的随机分量:[1/n,1/n,....,1/n],使用有偏随机分量,当你进行随机游走时,不是以概率 1/n 去每一页,而是去每一页概率为f(doc),其中 f(doc) 对于较新的页面较高,Sigma(f(doc)) = 1 [对于集合中的所有文档,因此您的随机分量将是 [f(doc1),f(doc2),...,f(docn)]

请注意,对于每个文档,必须是 f(doc)>0,否则无法保证收敛 [Perron-Frobenius 定理不适用]。


另一种可能性是计算常规页面排名,并将其与一个不同的函数g:Collection->R相乘,该函数为每个页面提供一个数值,页面越新,得分越高这份文件。

编辑:
作为对原始问题编辑的回应:
另一种可能性是在为网络生成图形时,添加附加信息w:E->[0,1],意思是:为每条边添加一个权重函数,表明它的重要性,如果链接是在原始编辑后不久建立的,w( e) 会更接近 1,如果更晚,分数会更接近 0。

在创建计算 pagerank 的矩阵时,输入Matrix[v1][v2] <- w((v1,v2)),而不是简单的二进制值,表示图中存在边。
一旦有了这个矩阵,就可以正常计算 PageRank。

【讨论】:

  • 对不起,我现在正在阅读这篇论文并试图理解它,这与新编辑的问题是否仍然相关?
  • @user956400:看看我的编辑:我认为它可能更适合您编辑的问题。
  • 这听起来更容易,但没有真正意识到页面排名可以用于非二进制数据。
  • 很好的答案,虽然在第一次阅读时似乎暗示 pagerank 是使用随机游走计算的,但事实并非如此。
猜你喜欢
  • 2012-10-04
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2015-04-15
  • 2013-06-06
  • 2020-07-13
  • 1970-01-01
相关资源
最近更新 更多