【问题标题】:EMR Spark job - usage of HDFS and EBS storageEMR Spark 作业 - HDFS 和 EBS 存储的使用
【发布时间】:2020-02-27 16:11:18
【问题描述】:

EMR 上的 Spark 是否将输入数据从 Amazon S3 分发到底层 HDFS?

也附加到节点的 EBS 卷的用途是什么?

【问题讨论】:

    标签: amazon-emr


    【解决方案1】:

    每个节点的根 EBS 卷用于操作系统和应用程序文件。默认情况下,这是一个 10GB 的卷。附加到核心节点的附加卷用于 HDFS。任务节点可能有额外的卷,但任务节点没有 HDFS 名称节点,并且不会存储 HDFS 数据。

    Instance Storage EMR 文档:

    实例存储和/或 EBS 卷存储用于 HDFS 数据,以及缓冲区、缓存、暂存数据和其他一些应用程序可能“溢出”到本地文件系统的临时内容。

    如果配置为这样做,Spark 会将临时数据存储在 HDFS 中。 你可以configure propertiesspark.local.dir 一样设置Spark 应该写入数据的位置。

    除非您专门将数据写入 HDFS,否则您不需要为核心节点配置大型 EBS 卷。我建议启动一个您估计需要的集群,然后随着 HDFS 需求的增加添加额外的核心节点。

    【讨论】:

      【解决方案2】:

      天气你是否指定 HDFS,它总是由 EMR 旋转。我找不到任何 EMR 旋转 HDFS 的文档;但根据我的经验,EMR 首先写入 HDFS 作为临时存储,然后将这些数据复制到 S3。根卷的某些部分用于托管此 HDFS --evn 虽然您在旋转 EMR 时没有选中 HDFS 复选框

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2018-10-26
        • 1970-01-01
        • 2019-04-05
        • 1970-01-01
        • 1970-01-01
        • 2015-10-26
        • 2017-02-10
        • 1970-01-01
        相关资源
        最近更新 更多