【发布时间】:2018-04-20 14:51:29
【问题描述】:
假设有一个 Spark 作业将从 HDFS 读取一个名为 records.txt 的文件,并进行一些转换和一个操作(将处理后的输出写入 HDFS)。作业将提交到 YARN 集群模式
还假设 records.txt 是一个 128 MB 的文件,其 HDFS 复制块之一也在 NODE 1 中
假设 YARN 分配的是 NODE 1 内的执行程序。
YARN如何在输入数据所在的节点准确分配一个executor?
谁告诉 YARN 复制的 HDFS 块的 records.txt 之一在节点 1 中可用?
Spark 应用程序如何找到数据局部性?它是由在 Application Master 中运行的 Driver 完成的吗?
YARN 是否知道数据局部性?
【问题讨论】:
-
我觉得this link 很有帮助
-
好问题,唯一的问题是 Yarn 是新 Hadoop 版本的一部分,所以它是众所周知的。