【问题标题】:Pull the data on a daily basis每天拉取数据
【发布时间】:2019-01-02 10:49:51
【问题描述】:

我的 redshift 集群中有数据,每天从 redshift 中提取数据并在 redshift 基础上通过几个 sql 查询创建一个新的新表 YY 的最佳方法是什么。

就像我们在 redshift 中有一个表 XX,我想在 redshift 中创建一个表,从表 XX 中提取前 10 行

创建表 YY as Select top 10 * from XX

【问题讨论】:

  • Redshift 中没有内置调度程序,您可以使用 crontab 在 ec2 上使用小型 linux 服务器进行自动化,如果您的要求很复杂,也可以使用气流。
  • 嗨,乔恩,谢谢您的回复。我们可以通过 Lambda 做到这一点吗?
  • lambda 除了最长持续时间(15 分钟)外都还可以,而且发现问题有点困难。
  • 谢谢。我无法将 Lambda 函数与 Redshift 链接。是否有任何视频或文档可供我联系,看看他们使用什么功能将 lambda 函数与 redshift 连接起来?

标签: amazon-redshift aws-glue


【解决方案1】:

使用AWS-Glue,您可以安排作业,然后编写脚本代码来执行特定操作。 AWS-glue 代码可以在以下 3 种类型的事件上触发,在您的情况下,我认为 #1 是适用的。

  1. 基于 cron 计划的触发器。
  2. 基于事件的触发器;例如,成功完成另一个作业可以启动 AWS Glue 作业。
  3. 按需启动作业的触发器。

我认为对于您的情况,this 应该更适用。

我希望这能给你一些指导。

【讨论】:

    猜你喜欢
    • 2022-12-01
    • 2011-09-11
    • 1970-01-01
    • 2020-06-28
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多