【发布时间】:2016-11-29 13:43:59
【问题描述】:
我有一个工作需要访问 HDFS 上的 parquet 文件,我想尽量减少网络活动。到目前为止,我已经在同一个节点上启动了 HDFS Datanodes 和 Spark Worker,但是当我启动我的工作时,数据位置始终位于它应该是 NODE_LOCAL 的任何位置,因为数据分布在所有节点之间。
我应该配置任何选项来告诉 Spark 启动数据所在的任务吗?
【问题讨论】:
标签: hadoop apache-spark hdfs