【发布时间】:2021-04-08 11:06:24
【问题描述】:
我已经定义了一些用 R 语言编写的函数...现在我正在尝试使用“spark.lapply”来并行化该函数。 所以到底发生了什么,我在函数内部定义了一个空向量,并且值在函数内部填充。
input_1:R 数据帧(虹膜数据)
函数定义:
agg_sum <- function(RowNum){
test <- "Hello"
input_1$sum <- input_1$Sepal.Length + RowNum
}
函数调用:
output_1 <- spark.lapply(1:5,function(RowNum) agg_sum(RowNum))
所以,如果我在使用 spark.lapply() 调用函数后稍后在代码中调用向量,我会收到错误消息:Error:object 'test' not found
【问题讨论】:
-
能否提供minimal reproducible example的代码,以便其他人更好地理解问题以便帮助您?
-
@Waldi 我已经添加了我的函数示例,我想要实现的目标
-
据我所知,像
input_1这样的全局变量必须在Spark中声明才能使用它们。
标签: r apache-spark lapply databricks sparkr