【发布时间】:2011-09-23 16:12:42
【问题描述】:
我收集了大约 200 万个文本文件,未压缩的总大小约为 10GB。我想在这个集合中找到包含短语的文档,这些短语看起来像“每次”或“比尔克林顿”(简单的不区分大小写的字符串匹配)。我也想找内容模糊的词组;例如“数周”。
我尝试过使用 Lucene 进行索引,但它不擅长查找包含停用词的短语,因为默认情况下这些短语会在索引时被删除。 xargs 和 grep 是一个缓慢的解决方案。对于这么大的数据量,什么是快速且合适的?
【问题讨论】:
-
当然是 Lucene。也许你应该问“我怎么能用 Lucene 做这个和那个”
-
关闭 Lucene 中的停用词处理?祝你好运。