【问题标题】:How search engines find the content duplication of a website搜索引擎如何找到网站的内容重复
【发布时间】:2010-09-17 12:48:44
【问题描述】:

我想知道搜索引擎如何发现网站中的内容是重复内容?

以及他们如何确定它可能被复制,他们是否使用任何特定技术或任何标语?

请给我建议。

【问题讨论】:

    标签: search-engine duplicates


    【解决方案1】:

    我不确定大型搜索引擎是如何做到的,但我使用的一种技术是对内容的 n-gram 进行最小化处理。我们为一个爬虫做了这个,我们发现许多损坏的网站链接到具有无限数量的唯一网址的同一页面。我们需要一种快速的方法来检测非常大的类似页面,以便我们可以应用更昂贵的重复内容检查。

    http://en.wikipedia.org/wiki/MinHash

    编辑:这里有更多链接,包括来自 Google

    的论文

    http://knol.google.com/k/simple-simhashing#

    http://infolab.stanford.edu/~manku/papers/07www-duplicates.pdf

    【讨论】:

      猜你喜欢
      • 2011-04-27
      • 1970-01-01
      • 2010-09-18
      • 1970-01-01
      • 1970-01-01
      • 2011-11-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多