【问题标题】:Tools for identifying near duplicate documents用于识别近似重复文档的工具
【发布时间】:2014-11-07 09:48:29
【问题描述】:

我正在做一个 NLP 项目,识别几乎重复的文档是其中的一部分。任何有这方面经验的人都可以推荐用于近似重复检测的工具(如 Weka 的实现)吗?

该项目是关于在分析一些当地英文报纸的新闻文章后生成犯罪统计报告。首先对犯罪物品进行分类。然后应该检测和合并重复的文章。数据收集可能包含大约 1000 篇与犯罪相关的文章,用于近似重复检测。

我在这里将近似重复定义为包含相同犯罪事件的文章。有时不同的报纸可能会报道相同的事件。同样的报纸也可能在不同的日子报道新闻文章。

重复检测所花费的时间不是问题,因为这不是在线处理。准确性在这里非常重要。

提前谢谢你。

【问题讨论】:

  • 你的收藏有多大?
  • 大约 1000 篇新闻文章。我更新了问题..

标签: nlp


【解决方案1】:

虽然duplicate content 的概念非常简单,但near-duplicate content 的概念可能存在问题。

例如,您是否将与同一事件相关的文档(例如来自不同来源的新闻文章)视为 NDC? 或者您是否考虑与 NDC 具有相同句法模式(例如天气预报)的文档?

考虑到您的目标,我认为您对以前的 NDC 定义更感兴趣,但应该更清楚地表达。

作为第一次体验,您可能想尝试 OnIOn (https://code.google.com/p/onion/) 一个专用于 DC/NDC 检测的工具,但考虑到您的语料库的大小(很小),您可能希望实现自己的 NDC 删除系统,基于您的对 NDC 的定义。 在这里,我建议您阅读 Broder 等人的开创性论文。 (http://www.hpl.hp.com/techreports/Compaq-DEC/SRC-TN-1997-015.pdf)... 给您一些想法。

【讨论】:

  • 非常感谢您的帮助...我认为与 NDC 同一事件有关的文件。我会检查工具和纸张..
  • 没问题。请记住,在 Broder 等人的情况下。他们必须处理大量文件,而且他们对 NDC 的定义与您的不同。在处理 NDC 时,它仍然是必读的。让我们知道进展如何。祝你好运。
猜你喜欢
  • 2021-01-11
  • 2020-07-09
  • 1970-01-01
  • 2011-05-13
  • 2017-04-15
  • 2011-06-23
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多