【发布时间】:2022-10-07 04:06:16
【问题描述】:
我正在查看在将数据帧写入 pyspark 中的 csv 时要传递的特定限制( 4GB )大小。我已经尝试过使用 maxPartitionBytes,但没有按预期工作。
下面是我在 hive-ORC 格式的 90 GB 表上使用和测试的表。在导出(写入)级别,它给出了 4 GB 以外的随机文件大小
此处有任何建议以在写入时拆分具有限制大小的文件。在这里,我不想使用重新分区或合并,因为 df 正在经历很多广泛的转换。
df.write.format(\"csv\").mode(\"overwrite\").option(\"maxPartitionBytes\", 4*1024*1024(1024).save(outputpath)
标签: python apache-spark pyspark spark2.4.4