【发布时间】:2020-07-31 15:14:18
【问题描述】:
我有一个要写入 HDFS 的 pyspark 数据帧。我正在使用以下命令:
df.write.mode("overwrite").option("header", "true").option("sep", "|").csv(outfile, compression="bzip2")
我正在观察一件奇怪的事情。数据框有 366,000 行,我使用 df.count() 函数获得。但是,write 命令的输出只有 72、557 行(wc -l 命令)。理想情况下,每一行都应该在输出中有对应的行。我一直用的write命令有什么问题吗?
【问题讨论】:
标签: python apache-spark pyspark hdfs