【发布时间】:2013-12-14 02:57:46
【问题描述】:
目前,据我了解,数据将从关系数据库 Sqooped 到 HDFS。从那里,Pig 或 M/R 可以运行 ETL 相关任务,并将转换后的数据放入 HDFS 的另一部分。然后可以根据需要删除原始数据。
有没有办法避免将原始数据导入 HDFS 并对通过 Sqoop 传入的数据运行 PIG 和 M/R?这是怎么做到的?
【问题讨论】:
标签: hadoop mapreduce apache-pig hdfs sqoop
目前,据我了解,数据将从关系数据库 Sqooped 到 HDFS。从那里,Pig 或 M/R 可以运行 ETL 相关任务,并将转换后的数据放入 HDFS 的另一部分。然后可以根据需要删除原始数据。
有没有办法避免将原始数据导入 HDFS 并对通过 Sqoop 传入的数据运行 PIG 和 M/R?这是怎么做到的?
【问题讨论】:
标签: hadoop mapreduce apache-pig hdfs sqoop