【发布时间】:2015-12-29 12:58:52
【问题描述】:
我是 Spark、SparkR 以及所有与 HDFS 相关的技术的新手。我最近安装了 Spark 1.5.0 并使用 SparkR 运行了一些简单的代码:
Sys.setenv(SPARK_HOME="/private/tmp/spark-1.5.0-bin-hadoop2.6")
.libPaths("/private/tmp/spark-1.5.0-bin-hadoop2.6/R/lib")
require('SparkR')
require('data.table')
sc <- sparkR.init(master="local")
sqlContext <- sparkRSQL.init(sc)
hiveContext <- sparkRHive.init(sc)
n = 1000
x = data.table(id = 1:n, val = rnorm(n))
Sys.time()
xs <- createDataFrame(sqlContext, x)
Sys.time()
代码立即执行。但是,当我将其更改为 n = 1000000 时,大约需要 4 分钟(两次 Sys.time() 调用之间的时间)。当我在端口:4040 的控制台中检查这些作业时,n = 1000 的作业持续时间为 0.2 秒,n = 1000000 的作业持续时间为 0.3 秒。我做错了吗?
【问题讨论】:
-
由于途中出现了一些意想不到的问题,我花了一段时间(在途中遇到了一些其他错误,更不用说我一直忘记您可以将多么奇怪的东西放在数据框列中)但这应该是在 1.6.0 中解决:SPARK-11086
标签: r apache-spark sparkr