【发布时间】:2014-11-07 09:48:29
【问题描述】:
我正在做一个 NLP 项目,识别几乎重复的文档是其中的一部分。任何有这方面经验的人都可以推荐用于近似重复检测的工具(如 Weka 的实现)吗?
该项目是关于在分析一些当地英文报纸的新闻文章后生成犯罪统计报告。首先对犯罪物品进行分类。然后应该检测和合并重复的文章。数据收集可能包含大约 1000 篇与犯罪相关的文章,用于近似重复检测。
我在这里将近似重复定义为包含相同犯罪事件的文章。有时不同的报纸可能会报道相同的事件。同样的报纸也可能在不同的日子报道新闻文章。
重复检测所花费的时间不是问题,因为这不是在线处理。准确性在这里非常重要。
提前谢谢你。
【问题讨论】:
-
你的收藏有多大?
-
大约 1000 篇新闻文章。我更新了问题..
标签: nlp