【发布时间】:2022-10-07 03:32:27
【问题描述】:
广泛的转换如何根据随机分区配置实际工作?
如果我有以下程序:
spark.conf.set(\"spark.sql.shuffle.partitions\", \"5\")
val df = spark
.read
.option(\"inferSchema\", \"true\")
.option(\"header\", \"true\")
.csv(\"...\\input.csv\")
df.sort(\"sal\").take(200)
这是否意味着 sort 会输出 5 个新分区(按照配置),然后 spark 从这 5 个分区中获取 200 条记录?
-
AFAIK
spark.sql.shuffle.partitions在此示例中不会发挥任何作用。
标签: apache-spark apache-spark-dataset spark-shuffle