【发布时间】:2013-03-14 02:47:07
【问题描述】:
我有一个非常大的纯文本文件,包含各种语言,比如英文、日文、中文……我想获取包含中文字符的行数。
我认为这可以使用 grep 和 wc -l 来完成,但我该如何实际完成这项工作呢?
cat filename | grep -P "[\x{4e00}-\x{9fcc}]" | wc -l
此命令不起作用,并有以下错误消息:
.grep: \x{...} 序列中的字符值太大。
【问题讨论】:
-
你使用什么样的 grep (
grep -V)? -
您不必进入 GREP。您可以使用
grep -opt "pattern" filename。不是很有帮助,我知道。但稍作调整。
标签: regex bash unicode grep cjk