【发布时间】:2021-03-19 04:30:01
【问题描述】:
我想用 spark 在 hdfs 中写一个大数据帧(150 go)。所以我做了:
df.coalesce(10).write.option("header",true).option("delimiter",";").csv("hdfsPath")
我希望每个输出 10 个 15 个分区的 csv 但我得到了一个包含所有数据的 csv 文件,我发现合并不起作用。 有什么办法解决这个问题吗?
【问题讨论】:
-
你试过
repartition()吗? -
Dataframe 变量 df 的实际分区数是多少?如果它们小于 10,则合并不会做任何事情。在这种情况下,您可能必须使用重新分区。
-
spark repartition 是按行还是按块大小拆分 csv 文件?换句话说,我会在输出中截断文件吗?
-
查看这篇文章以将大文件拆分为多个文件 - stackoverflow.com/questions/61338374/…
标签: scala csv apache-spark apache-spark-sql