【发布时间】:2019-01-16 08:06:56
【问题描述】:
我在 Zeppelin 上使用 R 来开发机器学习模型。我使用 %sparkr, sql(Constring, 'select * from table') 从 Hive 表中提取数据,默认情况下它会生成一个包含 9400 万条记录的 spark 数据框。
但是,我无法在此 Spark df 上执行所有 R 数据处理任务,因此我尝试使用 Collect(), as.data.frame() 将其转换为 R 数据帧,但我遇到了内存节点/超时问题。
我想知道堆栈溢出社区是否知道通过避免超时问题将 Spark df 转换为 R df 的任何其他方法?
【问题讨论】:
-
根据定义,这就是拥有 R 数据框所需的内容。
-
转换超时怎么办?
-
那么你不应该使用这些。您可以检查
gapply或dapply方法,它们以分布式方式对数据块进行操作。 -
使用 sparklyr 包怎么样,有什么输入吗?
标签: r apache-spark apache-spark-sql apache-zeppelin sparkr