【发布时间】:2016-10-02 01:49:45
【问题描述】:
我刚刚开始使用 Apache Spark。我正在使用集群模式(master、slave1、slave2),我想处理一个保存在 Hadoop(hdfs)中的大文件。我正在使用 SparkContext 中的 textFile 方法;在处理文件时,我监视节点,我可以看到只有 slave2 正在工作。处理后slave2有任务slave1没有任务。 如果我使用本地文件而不是使用 hdfs,那么两个从站同时工作。 我不明白为什么会有这种行为。请问,谁能给我一个线索?
【问题讨论】:
标签: apache-spark hdfs