【发布时间】:2018-01-05 23:01:45
【问题描述】:
我是 AWS 新手,如果之前有人问过这个问题,请见谅。
我有一个 REST API,它返回 2 个参数(姓名、电子邮件)。我想将此数据加载到 Redshift 中。
我想制作一个每 2 分钟启动一次并调用 REST API 的 Lambda 函数。 API 可能会在这 2 分钟内返回最多 3-4 条记录。
那么,在这种情况下,是否可以只执行插入操作,或者我仍然必须使用 COPY(使用 S3)?我只担心性能和无错误(稳健)的数据插入。
另外,Lambda 函数将每 2 分钟异步启动一次,因此插入操作可能会重叠(但数据不会重叠)。
在这种情况下,如果我选择 S3 选项,我担心之前 Lambda 调用生成的 S3 文件会被覆盖并发生冲突。
长话短说,在 redshift 中插入较少记录的最佳做法是什么?
PS:我也可以使用其他 AWS 组件。我什至研究了 Firehose,它非常适合我,但它无法将数据加载到 Private Subnet Redshift。
提前谢谢大家
【问题讨论】:
-
看起来您没有太多数据.. 那么当您拥有大量数据时,为什么您需要 Redshift,这是一种昂贵且理想的解决方案
-
还有其他巨大的表格,我们使用 AWS DMS 处理这些表格
标签: amazon-web-services amazon-s3 amazon-redshift amazon-kinesis-firehose