【发布时间】:2014-07-14 18:40:35
【问题描述】:
我是 Pig 新手,想运行两个聚合函数,但我不知道该怎么做。我的数据包含每行一个购买交易,其中我有一个 SKU(库存标识符)和客户为 SKU 支付的价格(价格可能会有所不同):
sku price_paid
--- ----------
123 21.70
789 62.12
123 22.10
123 19.78
456 11.91
789 55.13
我想生成以下列表,其中包含 SKU、购买 SKU 的次数以及为 SKU 支付的平均价格。该列表应按计数降序排序。
sku count ave_price_paid
--- --------- --------------
123 3 21.19
789 2 58.63
456 1 11.91
任何帮助将不胜感激。我目前还没有走多远:
A = LOAD 'mydata.csv' USING PigStorage(',') AS (sku:chararray, price_paid:double);
B = GROUP A BY sku;
【问题讨论】:
标签: hadoop mapreduce apache-pig