【发布时间】:2016-12-24 11:00:24
【问题描述】:
我刚开始使用 Sqoop Hands-on。我有一个问题,假设我在数据库中有 300 个表,我想对这些表执行增量加载。我知道我可以使用追加模式或上次修改的方式进行增量导入。
但是,如果工作中唯一不同的是表名、CDC 列和最后一个值/更新值,我是否必须创建 300 个工作?
有没有人尝试过使用相同的作业并将上述内容作为参数传递,该参数可以从循环中的文本文件中读取并为所有表并行执行相同的作业。
行业标准和建议是什么?
另外,有没有办法截断并重新加载非常小的 hadoop 表,而不是执行 CDC 并稍后合并表?
【问题讨论】:
标签: hadoop sqoop data-ingestion