【发布时间】:2015-08-08 20:50:25
【问题描述】:
我的数据目录中有 50 个文本文件(路径:/home/admin/Desktop/data)。我的任务是将文本文件中的数据展平(标记)并将输出存储在 50 个输出文件中。
以下是我为完成这项工作而建立的关系:
--This will load all the 50 text files.
A = Load '/home/admin/Desktop/data' Using PigStorage(',');
--This relation will create every word as a token and will flatten the data.
B = FOREACH A GENERATE FLATTEN(TOKENIZE($0));
STORE B into '/home/ameya/Desktop/PigOutput';
现在,当我执行这个 pig 脚本时,我只得到一个输出文件,用于 50 个输入文件。
如何得到50个不同的输出文件,每个文件都包含与其输入文件中的数据对应的输出数据?
【问题讨论】:
-
感谢伙伴以正确的方式添加 cmets :)
标签: hadoop apache-pig