【问题标题】:Keep existing files on loading redshift table with aws pipeline在使用 aws 管道加载 redshift 表时保留现有文件
【发布时间】:2015-09-27 13:34:36
【问题描述】:

我正在配置 AWS pipline 以使用 JSON S3 文件中的数据加载 redshift 表。

我正在使用 RedshiftActivity,一切都很好,直到我尝试配置 KEEP_EXISTING 加载方法。我真的不想在每次加载时截断我的表,而是保留现有信息并添加新记录。

Redshift 活动似乎需要在表中定义 PRIMARY KEY 才能工作(OK)...现在它还要求我配置 DISTRIBUTION KEY,但我对 EVEN 分发感兴趣,似乎 DISTRIBUTION KEY 不能与均匀分布风格。

我可以使用分配键模拟 EVEN 分配吗?

谢谢。

【问题讨论】:

    标签: amazon-web-services amazon-redshift amazon-data-pipeline


    【解决方案1】:

    在 Redshift 中创建表时,我不关心主键。对于 distkey,您希望选择一个其值随机分布的字段,理想情况下。

    在您增量插入的情况下,我通常只是使用 SQLActivity 将数据从 s3 复制到 Redshift 中的临时表。然后我根据业务逻辑执行更新/插入/去重和任何步骤。最后我删除了临时表。完成。

    【讨论】:

      猜你喜欢
      • 2019-11-07
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-05-15
      • 2020-12-30
      • 2015-08-03
      • 2017-12-29
      • 1970-01-01
      相关资源
      最近更新 更多