【发布时间】:2013-01-11 13:51:37
【问题描述】:
在 Hadoop 中,我有很多看起来像这样:
(item_id,owner_id,counter) - 可能有重复,但item_id 总是有相同的owner_id!
我想为每个 item_id 获取 counter 的总和,所以我有以下脚本:
alldata = LOAD '/path/to/data/*' USING D; -- D describes the structure
known_items = FILTER alldata BY owner_id > 0L;
group_by_item = GROUP known_data BY (item_id);
data = FOREACH group_by_item GENERATE group AS item_id, OWNER_ID_COLUMN_SOMEHOW, SUM(known_items.counter) AS items_count;
问题在于,在FOREACH 中,如果我想采用known_items.owner_id - 那将是一个包含所有分组item_id 总和的元组。获得第一个所有者的最有效方法是什么?
【问题讨论】:
标签: hadoop apache-pig