【发布时间】:2019-09-13 20:08:38
【问题描述】:
我正在开发 spark 1.6.1
我有一个分布式数据框,它肯定比我集群中的任何节点都大。
如果我把所有都带入一个节点会发生什么?
df.coalesce(1)
工作会失败吗?
谢谢
【问题讨论】:
-
简短回答:是的。
-
要添加到 eliasah 的答案,它将失败并出现
OutOfMemory异常。有很多方法可以规避coalesce的需要。您想通过将所有数据提供给驱动程序来实现什么目标?
标签: apache-spark apache-spark-sql coalesce