【发布时间】:2017-01-08 07:28:57
【问题描述】:
我正在做以下过程
rdd.toDF.write.mode(SaveMode.Append).partitionBy("Some Column").parquet(output_path)
但是,在每个分区下,parquet 文件太多,而且每个文件的大小都非常小,这会使我接下来的步骤加载所有 parquet 文件变得很慢。有没有更好的办法,在每个分区下,减少parquet文件,增加单个parquet文件的大小?
【问题讨论】:
-
问题详细解决方法请转stackoverflow.com/questions/41840837/…
标签: apache-spark dataframe rdd partition bigdata