【发布时间】:2016-02-09 14:42:32
【问题描述】:
我正在使用 S3DistCp 将内容从 S3 复制到 Amazon EMR HDFS。对于某些作业,我的空间不足,并希望通过减少复制因子来解决这个问题。但我看不到在工作层面上实现这一目标的方法。有人可以帮忙解决这个问题吗?
【问题讨论】:
标签: hadoop amazon-web-services mapreduce emr
我正在使用 S3DistCp 将内容从 S3 复制到 Amazon EMR HDFS。对于某些作业,我的空间不足,并希望通过减少复制因子来解决这个问题。但我看不到在工作层面上实现这一目标的方法。有人可以帮忙解决这个问题吗?
【问题讨论】:
标签: hadoop amazon-web-services mapreduce emr
您通常不希望逐个作业修改集群的复制因子。复制用于数据冗余(在发生故障的情况下)和提高性能(通过使数据更接近计算操作)。最好将集群保留为预定义的值。
默认情况下,对于 1-3 个核心节点,Amazon EMR 将默认复制因子设置为 1,对于 4-9 个核心节点,该值设置为 2,对于 10+ 个核心节点,该值设置为 3。
理论上您可以更改dfs.replication 设置,但这可能不是解决您当前问题的最佳方法。
【讨论】: