【发布时间】:2013-05-24 12:16:02
【问题描述】:
我们以 wordCount 为例:
input_lines = LOAD '/tmp/my-copy-of-all-pages-on-internet' AS (line:chararray);
-- Extract words from each line and put them into a pig bag
-- datatype, then flatten the bag to get one word on each row
bag_words = FOREACH input_lines GENERATE FLATTEN(TOKENIZE(line)) AS word;
是否可以序列化“bag_words”变量,这样我们就不必在每次执行脚本时都重新构建整个包?
谢谢。
【问题讨论】:
-
你不能把 bag_words 写到一个文件然后再读进去吗?
标签: hadoop mapreduce bigdata apache-pig