【问题标题】:How to write a pig algebraic udf for group by如何为 group by 编写猪代数 udf
【发布时间】:2014-04-14 21:30:24
【问题描述】:

我想编写一个猪代码来执行分组并生成 31 个字段的总和,但在此之前我需要进行一些自定义处理,为此我编写了一个 eval 函数。我想如果我可以将 GROUP 和 SUM 操作包含到 UDF 中,我可以让它运行得更快。要做到这一点,我可以使用代数 UDF,如果可以的话,我的 inital()、intermed() 和 final() 的返回模式如何,如果没有,我还能如何实现它。下面是我的代码,谢谢。

a = LOAD './a' using PigStorage('|') AS (val:int, grp1, grp2, amt1:long, amt2:long, amt3 ... amt31:long);

b = FOREACH a GENERATE myudfs.Custom(val) AS custom_val, grp1, grp2, amt1 ... amt31;

c = GROUP b BY (custom_val,grp1, grp2);

d = FOREACH c GENERATE group, SUM(b.amt1) ... SUM(b.amt31);

store d into './op';

【问题讨论】:

    标签: java hadoop apache-pig hdfs


    【解决方案1】:

    如何在 UDF 中执行 GROUP...?

    GROUP 正在 Pig 中被翻译成 MapReduce 作业(该作业的中间键将从 custom_val、grp1、grp2 组合)。

    在 Reducer 中完成了对某个组的整个元组列表进行迭代 (FOREACH) 的能力。

    代数 UDF 不会“包含 GROUP”,但会作为 GROUP 聚合的一部分执行。所以我认为代数在这里不相关。

    我猜你可能在这里做的唯一优化是对原始 val 进行分组,并且仅在 GROUP 之后调用 myudfs.Custom(val)。

    假设您的 UDF 是 injective function

    a = LOAD './a' using PigStorage('|') AS (val:int, grp1, grp2, amt1:long, amt2:long, amt3 ... amt31:long);
    c = GROUP b BY (val,grp1, grp2);
    d = FOREACH c GENERATE myudfs.Custom(group) AS custom_val, SUM(b.amt1) ... SUM(b.amt31);
    store d into './op';
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-03-19
      • 2021-12-30
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-12-24
      相关资源
      最近更新 更多