【问题标题】:Word Count with custom delimiter (|) using Pig使用 Pig 使用自定义分隔符 (|) 进行字数统计
【发布时间】:2017-06-13 02:02:30
【问题描述】:

我是 Pig latin 的新手。我想处理以下文件并计算出现次数最多的单词。

Hadoop|是|一个|开放|源|基于Java的|编程|框架|那个|支持| |处理|和|存储|的|极端|大|数据|集合|在|a|分布式|计算|环境。

该文件包含| 作为分隔符。

【问题讨论】:

    标签: hadoop apache-pig


    【解决方案1】:

    字数统计的例子有很多。无论如何,这里有一个带有分隔符'|'的例子

    lines = LOAD 'input.txt' AS (line:chararray);
    newlines = FOREACH lines GENERATE REPLACE(line,'\\|',' ') AS newline;
    words = FOREACH newlines GENERATE FLATTEN(TOKENIZE(newline)) as word;
    grouped = GROUP words BY word;
    w_count = FOREACH grouped GENERATE group, COUNT(words);
    DUMP w_count;
    

    【讨论】:

    • @inquistive_mind 你可以逃脱 |由\\即newlines = FOREACH lines GENERATE REPLACE(line,'\\|',' ') AS newline
    猜你喜欢
    • 1970-01-01
    • 2013-05-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-12-15
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多