【发布时间】:2020-02-27 16:11:18
【问题描述】:
EMR 上的 Spark 是否将输入数据从 Amazon S3 分发到底层 HDFS?
也附加到节点的 EBS 卷的用途是什么?
【问题讨论】:
标签: amazon-emr
EMR 上的 Spark 是否将输入数据从 Amazon S3 分发到底层 HDFS?
也附加到节点的 EBS 卷的用途是什么?
【问题讨论】:
标签: amazon-emr
每个节点的根 EBS 卷用于操作系统和应用程序文件。默认情况下,这是一个 10GB 的卷。附加到核心节点的附加卷用于 HDFS。任务节点可能有额外的卷,但任务节点没有 HDFS 名称节点,并且不会存储 HDFS 数据。
Instance Storage EMR 文档:
实例存储和/或 EBS 卷存储用于 HDFS 数据,以及缓冲区、缓存、暂存数据和其他一些应用程序可能“溢出”到本地文件系统的临时内容。
如果配置为这样做,Spark 会将临时数据存储在 HDFS 中。
你可以configure properties 和spark.local.dir 一样设置Spark 应该写入数据的位置。
除非您专门将数据写入 HDFS,否则您不需要为核心节点配置大型 EBS 卷。我建议启动一个您估计需要的集群,然后随着 HDFS 需求的增加添加额外的核心节点。
【讨论】:
天气你是否指定 HDFS,它总是由 EMR 旋转。我找不到任何 EMR 旋转 HDFS 的文档;但根据我的经验,EMR 首先写入 HDFS 作为临时存储,然后将这些数据复制到 S3。根卷的某些部分用于托管此 HDFS --evn 虽然您在旋转 EMR 时没有选中 HDFS 复选框
【讨论】: