【发布时间】:2015-12-12 09:20:14
【问题描述】:
我们需要增量运行 HiveQL 并将结果导出到 avro fromat 中的文件,我们需要导出记录。
以下是我正在研究的两种方式以及我在使用它们时遇到的挑战。
选项 1:使用 Pig 和客户加载器: 一种。编写一个运行 hive 查询的自定义 pig loader。 湾。编写一个 pig 流并创建与 hive loader 的结果的关系。 C。将结果保存在 avro 文件中。
选项 2. SQOOP 导出 - 我找不到增量导出 hive 查询结果的原因。
到目前为止,根据我的分析,我认为使用选项 1 将更适合我的要求。
如果您认为我们可以在 sqoop 中轻松实现这一点,有人可以解释一下吗?
【问题讨论】: