【发布时间】:2018-06-06 06:48:26
【问题描述】:
我使用的是 MS Windows 7。
最初,我在 Spark 1.6 中尝试了一个使用 scala 的程序,它运行良好(我自动将 SparkContext 对象作为 sc 获取)。
当我尝试使用 Spark 2.2 时,我没有自动获得sc,所以我通过以下步骤创建了一个:
import org.apache.spark.SparkContext
import org.apache.spark.SparkConf
val sc = new SparkConf().setAppName("myname").setMaster("mast")
new SparkContext(sc)
现在,当我尝试执行以下并行化方法时,它给了我一个错误:
val data = Array(1, 2, 3, 4, 5)
val distData = sc.parallelize(data)
错误:
Value parallelize is not a member of org.apache.spark.SparkConf
我仅使用官方文档执行了这些步骤。那么有人可以解释我哪里出错了吗?提前致谢。 :)
【问题讨论】:
-
我从 “我在哪里自动将 SparkContext 对象作为 sc 获取” 了解到您使用
spark-shell,不是吗?您是否在$HADOOP_HOME/bin中定义了HADOOP_HOME和/或保存了winutils.exe?
标签: scala apache-spark windows-7