【问题标题】:State-of-the-art method for large-scale near-duplicate detection of documents?用于大规模近重复检测文档的最先进方法?
【发布时间】:2017-11-05 09:44:26
【问题描述】:

据我了解,NLP 中的科学共识是,在大规模科学文档集合(超过 10 亿份文档)中进行近重复检测的最有效方法是在这里找到的方法:

http://infolab.stanford.edu/~ullman/mmds/ch3.pdf

可以简单描述为:

a) 文件的拼接 b) minhash 以获取 shingles 的 minhash 签名 c) 局部敏感散列以避免对所有签名进行成对相似性计算,而是只关注桶内的对。

我已经准备好在 Map-Reduce 或 Spark 中实现这个算法,但是因为我是这个领域的新手(我已经阅读了大约两周的大规模近似重复检测),并且上面发表的内容相当多几年前,我想知道上述算法是否存在已知的局限性,以及是否有更有效的不同方法(提供更有吸引力的性能/复杂性权衡)。

提前致谢!

【问题讨论】:

    标签: machine-learning nlp


    【解决方案1】:

    关于第二步 b),最近的一些进展显着加快了签名的计算:

    【讨论】:

      猜你喜欢
      • 2019-06-21
      • 1970-01-01
      • 2013-05-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-11-18
      • 2012-09-27
      • 2021-03-12
      相关资源
      最近更新 更多