【问题标题】:Algorithm for ranking popular blog posts流行博客文章排名的算法
【发布时间】:2012-03-05 16:40:58
【问题描述】:

我正在构建一个博客聚合器,例如 Techmeme,它可以从多个博客中找到最受欢迎的帖子。与 Techmeme 不同的是,我首先从各种 RSS 提要中汇总博客文章,然后将标题和相关 URL 保存在数据库中。之后,我必须找出最受欢迎的博文是什么。

为了定义顶级博客文章标题,我跟踪每个博客的每篇文章的 Facebook 和 Twitter 分享计数,并根据它们的分享计数对博客文章进行排名。但这并不是最好的解决方案,因为一些博主可以通过欺诈性分享增加分享次数来作弊。

所以我的问题是我可以使用什么标准来定义最受欢迎的帖子是什么? 对博客文章进行排名的更好算法是什么?

【问题讨论】:

  • Google 趋势提供每日唯一访问者数量。但是,它看起来没有任何官方的 api。不确定它与博客文章的效果如何,因为我认为它们可能不是从谷歌搜索中导航到的。 trends.google.com/websites
  • 但没有所有博客或博客文章的数据。只有全球流行的。因为我的项目是本地的,而不是全球的,所以这个工具对我没有帮助:(

标签: algorithm blogs analysis


【解决方案1】:

由于在这种情况下“流行”一词含糊不清,我会根据我的标准来定义帖子的流行度。结合所有建议的答案,为博客文章建立一个合理的声誉系统。例如,基本上我会做这样的事情。

  • facebook 分享 x 2
  • 推特分享 x 3
  • 域名的pagerank x 2
  • 50 000 / 全球 Alexa 评级
  • 等等

最后,您可以总结所有这些并进行比较。此外,您可以根据帖子大小、帖子中的图片数量等制定一些标准。

【讨论】:

  • 你如何决定分享/喜欢等的乘法因子。我的意思是,为什么(Facebook 分享 x 2)而不是(Facebook 分享 x 30)
  • @Jayesh 我只是为了示例而编造了它们。这取决于你(你给予的重要性)
  • 谢谢@Ferhad 我只是想了解到达那里的过程是什么。您总是从随机权重开始并尝试在一段时间内调整误差,还是有任何确定的方法来获得这些?
【解决方案2】:

可以估计不同来源的股份的联合分布。很难检测边缘化(即单一)指标的欺诈行为,但更难伪造整体的“有机”概况。

【讨论】:

    【解决方案3】:

    如何使用 PageRank 的变体?

    这里有更多细节。 http://pr.efactory.de/e-pagerank-algorithm.shtml http://en.wikipedia.org/wiki/PageRank?PHPSESSID=e371f8cacb91eff0c852a0e001893a9a

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-01-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-06-03
      • 2020-10-12
      相关资源
      最近更新 更多