【发布时间】:2016-06-21 18:10:50
【问题描述】:
我是 PIG 的新手,我有一个问题。不知道有没有可能。
首先,我有一个文件:
?(A, B, C, D) :- File1(A), File2(B), File3(C), File4(A, B), File5 (A, C), File6(C, B) , 文件 7(A, D)。
我必须在 PIG 中创建一个脚本,获取这个文件,然后,对于每个条目,研究文件中的参数 ...
比如这个,脚本要在File1中找到参数A,在File2中找到B,File3C ...
但我不知道有多少文件。它们只能有 1 个或 2 个参数。
我可以轻松加载这些文件,它们都有 2 列。
对于每个文件{
A = 使用 PigStorage (':') 加载 'FileX' 作为 (Col1:chararray, Col2:chararray);
B = 按 Col1 == X AND Col2== Y 过滤 A;
使用 PigStorage(' ') 将 B 存储到“结果”中;
}
这种类型的代码可能吗?
在第二种方式中,我想用相同的参数重新组合文件: 对于 File1、File5 和 File7 通过一个组,或者什么... 避免重复相同的过滤。 我做了很多测试,但我没有发现任何有用的东西。 谢谢你:)
【问题讨论】:
-
您的第一个文件是否也在 hdfs 中?
-
是的,它也在 Hdfs 中:)
标签: apache-pig