【发布时间】:2016-08-16 19:10:43
【问题描述】:
我正在使用 AWS 将我的 S3 存储桶中的 COPY 日志文件记录到我的 Redshift 集群内的一个表中。每个文件大约有 100MB,我还没有'gziped' 他们。我现在有 600 个这些文件,而且还在增长。我的集群有 2 个dc1.large 计算节点和一个领导节点。
问题是,COPY 运行时间太大,至少40分钟。加快速度的最佳方法是什么?
1) 获得更多节点或为节点提供更好的机器?
2) 如果我对文件进行 gzip 压缩,那么在COPY 操作时间增益方面真的很重要吗?
3) 有什么设计模式在这里有帮助吗?
【问题讨论】: