【发布时间】:2019-10-29 04:36:57
【问题描述】:
我正在寻找一种方法来根据可用核心的大小对我的应用程序中的所有数据帧进行分区。如果我的可用核心(执行器数 * 每个执行器的核心数)为 20,那么我想重新分区所有我的数据框到 20..
我可以看到重新分区我的数据帧的唯一方法是df.repartition(20),但我希望将其应用于我的应用程序中存在的所有数据帧,而不必为每个数据帧编写df.repartition(20)。
更改 spark.default.parallelism conf 不起作用,因为它仅在您使用 RDD(较低级别的 api)而不是数据帧时应用。
对此有什么建议吗?
【问题讨论】:
标签: apache-spark apache-spark-sql sparkcore