【发布时间】:2017-06-13 02:02:30
【问题描述】:
我是 Pig latin 的新手。我想处理以下文件并计算出现次数最多的单词。
Hadoop|是|一个|开放|源|基于Java的|编程|框架|那个|支持| |处理|和|存储|的|极端|大|数据|集合|在|a|分布式|计算|环境。
该文件包含| 作为分隔符。
【问题讨论】:
标签: hadoop apache-pig
我是 Pig latin 的新手。我想处理以下文件并计算出现次数最多的单词。
Hadoop|是|一个|开放|源|基于Java的|编程|框架|那个|支持| |处理|和|存储|的|极端|大|数据|集合|在|a|分布式|计算|环境。
该文件包含| 作为分隔符。
【问题讨论】:
标签: hadoop apache-pig
字数统计的例子有很多。无论如何,这里有一个带有分隔符'|'的例子
lines = LOAD 'input.txt' AS (line:chararray);
newlines = FOREACH lines GENERATE REPLACE(line,'\\|',' ') AS newline;
words = FOREACH newlines GENERATE FLATTEN(TOKENIZE(newline)) as word;
grouped = GROUP words BY word;
w_count = FOREACH grouped GENERATE group, COUNT(words);
DUMP w_count;
【讨论】:
newlines = FOREACH lines GENERATE REPLACE(line,'\\|',' ') AS newline