【发布时间】:2016-11-23 18:43:01
【问题描述】:
我正在尝试在 YARN 模式下使用 spark 提交在 hadoop 集群上启动 spark 任务。
我正在从我的开发机器上启动 spark-submit。
根据Running Spark On YARN docs,我应该在环境变量HADOOP_CONF_DIR 或YARN_CONF_DIR 上提供hadoop 集群配置的路径。这就是棘手的地方:如果我将任务发送到远程 YARN 服务,为什么这些文件夹必须存在于我的本地计算机上?这是否意味着 spark-submit 必须位于集群内部,因此我无法远程启动 spark 任务?如果没有,我应该用什么填充这些文件夹?我应该从任务管理器服务所在的YARN集群节点复制hadoop配置文件夹吗?
【问题讨论】:
标签: hadoop apache-spark hadoop-yarn