【发布时间】:2018-09-12 13:27:44
【问题描述】:
我有以下数据集,其中 emp_id、org_id 和 res_id 是关键列
输入数据是 -
emp_id | org_id | res_id | emp_sal
123 | 345 | 678 | 10000
123 | | 678 | 20000
123 | 345 | | 30000
| 345 | 678 | 10000
103 | 305 | 608 | 40000
103 | | | 50000
如果剩余记录是完整键的子集,我需要聚合 emp_sal。例如 "123 | 345 | 678 |" 在输入数据集中还有 3 个子集。
预期输出是 -
emp_id | org_id | res_id | emp_sal
123 | 345 | 678 | 70000
103 | 305 | 608 | 90000
如何在 Pig 中计算此聚合?
【问题讨论】:
-
已经尝试过“CUBE And ROLLUP For Multi-Level Aggregations”
-
修复您的餐桌设计。
emp_id怎么可能对于看起来像员工表的东西是空白的?理想情况下,您应该有一个唯一的密钥
标签: hadoop hive hdfs bigdata apache-pig