【问题标题】:Line count discrepancy in pyspark write csvpyspark写入csv中的行数差异
【发布时间】:2020-07-31 15:14:18
【问题描述】:

我有一个要写入 HDFS 的 pyspark 数据帧。我正在使用以下命令: df.write.mode("overwrite").option("header", "true").option("sep", "|").csv(outfile, compression="bzip2")

我正在观察一件奇怪的事情。数据框有 366,000 行,我使用 df.count() 函数获得。但是,write 命令的输出只有 72、557 行(wc -l 命令)。理想情况下,每一行都应该在输出中有对应的行。我一直用的write命令有什么问题吗?

【问题讨论】:

    标签: python apache-spark pyspark hdfs


    【解决方案1】:

    事实证明,有些行的所有元素都为空。这导致了行数的差异。

    并且这些行是空的,因为在读取数据框时,我传递了一个手动定义的模式。不遵循架构的行作为空行插入到数据框中。

    【讨论】:

      猜你喜欢
      • 2017-12-03
      • 2014-06-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多