【发布时间】:2015-12-20 03:33:06
【问题描述】:
我有一个非常大的 txt 文件 (500GiB),我想获取其唯一单词的数量。我试过this,但它似乎很慢,因为它确实排序:
grep -o -E '\w+' temp | sort -u -f | wc -l
有没有更好的方法?
【问题讨论】:
-
您有 500 GiB 的备用磁盘空间吗?
-
尝试
awk(将单词放入 awk 关联数组),看看是否足够快。如果没有,我会用 C++(或类似的东西)编写一个自定义程序。 -
@rici 是的(这里还有几个字来满足回复的字符限制)
-
对不起,我的想法并没有变得更快。
-
bash uniq 程序好像没有解决,但为什么呢?