【发布时间】:2021-03-03 01:30:05
【问题描述】:
我一直在使用 AWS Data Pipeline 将数据从 DynamoDB 迁移到 S3。数据大小约为 20 GB。对此有什么想法吗?
【问题讨论】:
标签: amazon-web-services amazon-s3 amazon-dynamodb data-migration
我一直在使用 AWS Data Pipeline 将数据从 DynamoDB 迁移到 S3。数据大小约为 20 GB。对此有什么想法吗?
【问题讨论】:
标签: amazon-web-services amazon-s3 amazon-dynamodb data-migration
AWS DataPipeline 将整个 DynamoDB 表导出到 one file in S3。这个特定的 Data Pipeline 模板将使用由 MyExportJob.myDynamoDBReadThroughputRatio 变量定义的 percentage of your table's provisioned capacity,并将适当地扩展 MapReduce 作业集群。您可以将读取吞吐率设置为 0 到 1 (0%-100%)。
如果您有 20GB 的数据,并且 Data Pipeline scans your table in parallel 使用 MapReduce,您将消耗 5242880 RCU。您希望备份花费多长时间取决于您。如果您将读取吞吐量比设置为 1 并将 RPS 设置为 11988 RPS,则扫描 DynamoDB 表大约需要 5242880 / 11988 = 437 秒(4 分 17 秒)。数据管道作业运行时间应该成比例并且非常接近扫描表所需的时间。请记住,Data Pipeline 必须启动一个集群并将备份写入 S3。
【讨论】: