【发布时间】:2017-11-05 09:44:26
【问题描述】:
据我了解,NLP 中的科学共识是,在大规模科学文档集合(超过 10 亿份文档)中进行近重复检测的最有效方法是在这里找到的方法:
http://infolab.stanford.edu/~ullman/mmds/ch3.pdf
可以简单描述为:
a) 文件的拼接 b) minhash 以获取 shingles 的 minhash 签名 c) 局部敏感散列以避免对所有签名进行成对相似性计算,而是只关注桶内的对。
我已经准备好在 Map-Reduce 或 Spark 中实现这个算法,但是因为我是这个领域的新手(我已经阅读了大约两周的大规模近似重复检测),并且上面发表的内容相当多几年前,我想知道上述算法是否存在已知的局限性,以及是否有更有效的不同方法(提供更有吸引力的性能/复杂性权衡)。
提前致谢!
【问题讨论】:
标签: machine-learning nlp