【问题标题】:Set HDFS replication factor while running S3DistCp在运行 S3DistCp 时设置 HDFS 复制因子
【发布时间】:2016-02-09 14:42:32
【问题描述】:

我正在使用 S3DistCp 将内容从 S3 复制到 Amazon EMR HDFS。对于某些作业,我的空间不足,并希望通过减少复制因子来解决这个问题。但我看不到在工作层面上实现这一目标的方法。有人可以帮忙解决这个问题吗?

【问题讨论】:

    标签: hadoop amazon-web-services mapreduce emr


    【解决方案1】:

    您通常不希望逐个作业修改集群的复制因子。复制用于数据冗余(在发生故障的情况下)和提高性能(通过使数据更接近计算操作)。最好将集群保留为预定义的值。

    默认情况下,对于 1-3 个核心节点,Amazon EMR 将默认复制因子设置为 1,对于 4-9 个核心节点,该值设置为 2,对于 10+ 个核心节点,该值设置为 3。

    理论上您可以更改dfs.replication 设置,但这可能不是解决您当前问题的最佳方法。

    【讨论】:

    • 让我给你一些更多的背景信息。我的大部分工作都使用 S3 存储桶作为数据源。对于那些工作,我们不想通过将复制因子设置为大于 1 来浪费 HDFS 中的空间。但是还有一些其他工作使用 HDFS 作为主要数据源,我们需要冗余。我不确定是否有任何明确的解决方案,但只是想把这个问题放在那里以获得建议。感谢您的帮助
    • 我发现一些参考资料说“每个文件可以配置块大小和复制因子”,但我不清楚它是如何完成的。我想知道这是否可以作为 S3DistCp 的一部分,在每个文件的基础上而不是在集群范围的基础上合并?
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-07-24
    • 2013-07-21
    • 2016-05-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多