【发布时间】:2014-07-15 05:06:16
【问题描述】:
当我使用cache 存储数据时,我发现spark 运行很慢。但是,当我不使用cache 方法时,速度非常好。我的主要配置文件如下:
SPARK_JAVA_OPTS+="-Dspark.local.dir=/home/wangchao/hadoop-yarn-spark/tmp_out_info
-Dspark.rdd.compress=true -Dspark.storage.memoryFraction=0.4
-Dspark.shuffle.spill=false -Dspark.executor.memory=1800m -Dspark.akka.frameSize=100
-Dspark.default.parallelism=6"
而我的测试代码是:
val file = sc.textFile("hdfs://10.168.9.240:9000/user/bailin/filename")
val count = file.flatMap(line => line.split(" ")).map(word => (word, 1)).cache()..reduceByKey(_+_)
count.collect()
非常感谢任何有关我如何解决此问题的答案或建议。
【问题讨论】:
-
我不认为这是一个可怕的问题,不确定投票的目的是什么。
cache函数的使用并不总是很清楚。此外,这个问题写得也不错,而且很努力
标签: performance caching apache-spark