【发布时间】:2020-02-21 10:26:16
【问题描述】:
我正在使用以下脚本编写分区输出。
.write
.format("csv")
.partitionBy("date","region")
.option("delimiter", "\t")
.mode("overwrite")
.save("s3://mybucket/myfolder/")
但是,这会导致每个分区下有 1 个文件。我想在每个分区下有多个类似大小的文件。我怎样才能达到同样的效果。我在火花2.2。
我尝试使用附加密钥作为重新分区的一部分,例如 df_input_table.repartition($"region",$"date",$"region")。但是,这会导致文件大小不同。
我想坚持使用 spark(而不是 Hive)。
【问题讨论】:
标签: scala apache-spark