【发布时间】:2015-08-22 02:36:12
【问题描述】:
我正在浏览 spark 的文档。我对 rdd.repartition() 函数和我们在 sc.parallelize() 中的上下文初始化期间传递的分区数有点困惑。
我的机器上有 4 个内核,如果我 sc.parallelize(data, 4) 一切正常,但是当我 rdd.repartition(4) 并应用 rdd.mappartitions(fun) 有时分区没有数据并且我的在这种情况下,函数会失败。
所以,只是想了解这两种分区方式有什么区别。
【问题讨论】:
-
两者都可能导致空分区。当您编写一个打算与
mapPartitions一起使用的函数时,您应该简单地考虑到这一点。
标签: python apache-spark rdd