【问题标题】:Apache pig program阿帕奇猪程序
【发布时间】:2016-11-05 19:22:25
【问题描述】:

需要帮助编写用于计算单词数的猪脚本

包含以下文本的文件

What|is|Hadoop
History|of|Hadoop
How|Hadoop|name|was|given
Problems|with|Traditional|Large-Scale|Systems|and|Need|for|Hadoop
Understanding|Hadoop|Architecture
Fundamental|of|HDFS|(Blocks,|Name|Node,|Data|Node,|Secondary|Name|Node)
Rack|Awareness
Read/Write|from|HDFS
HDFS|Federation|and|High|Availability

【问题讨论】:

    标签: hadoop apache-pig bigdata


    【解决方案1】:

    将数据加载到字符数组中。替换“|”带空格,即 ' ' 并标记将为您提供单词的行,然后对单词进行分组和计数

    A = LOAD '/user/hadoop/data.txt' AS (line:chararray);
    B = FOREACH A GENERATE FLATTEN(TOKENIZE(REPLACE(line,'\\|',' ')));
    C = GROUP B BY $0;
    D = FOREACH C GENERATE group, COUNT(B);
    DUMP D;
    

    输出

    【讨论】:

    • 从上面的代码输出我得到单个字母。我想显示单词然后计数。输出如下所示: (W) (h) (a) (t) (|) (i) (s) (|) (H) (a) (d) (o) (o) (p) ...我想以以下方式显示输出(什么),(hadoop)..你能帮忙
    猜你喜欢
    • 1970-01-01
    • 2015-04-05
    • 2014-10-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-03-15
    相关资源
    最近更新 更多