【问题标题】:Can a single sqoop job be used for multiple tables and be running at the same time单个 sqoop 作业可以用于多个表并同时运行吗
【发布时间】:2016-12-24 11:00:24
【问题描述】:

我刚开始使用 Sqoop Hands-on。我有一个问题,假设我在数据库中有 300 个表,我想对这些表执行增量加载。我知道我可以使用追加模式或上次修改的方式进行增量导入。

但是,如果工作中唯一不同的是表名、CDC 列和最后一个值/更新值,我是否必须创建 300 个工作?

有没有人尝试过使用相同的作业并将上述内容作为参数传递,该参数可以从循环中的文本文件中读取并为所有表并行执行相同的作业。

行业标准和建议是什么?

另外,有没有办法截断并重新加载非常小的 hadoop 表,而不是执行 CDC 并稍后合并表?

【问题讨论】:

    标签: hadoop sqoop data-ingestion


    【解决方案1】:

    有 import-all-tables "从数据库导入表到 HDFS" 但是,它不会提供更改每个表的 CDC 列的方法。 另见sqoop import multiple tables

    没有截断,但可以通过以下方式实现。 --delete-target-dir "如果存在则删除导入目标目录"

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-09-24
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多