【问题标题】:The CSV File Parse in Spark is not in correct formatSpark 中的 CSV 文件解析格式不正确
【发布时间】:2021-09-15 10:25:51
【问题描述】:

我是数据科学的新手,我正在使用带有 PySpark API 的 Spark。我想创建一个 .CSV 文件的 DataFrame。当我这样做时,列将移动到一个单列,如下所示。

我用来创建 CSV 文件的 DataFrame 的命令是

from pyspark.sql import SparkSession

spark = SparkSession.builder.appName("MyFirstCSVLoad").getOrCreate()

df = spark.read.csv("order.csv")

df.Show()

谁能帮我解决这个问题。

CSV 文件的链接 https://mega.nz/file/opQFxQbJ#Csjk-CtAkb1CwB6F3hULk3xJxkAOdPyAMMCFjI30MEk

【问题讨论】:

    标签: csv apache-spark pyspark jupyter-notebook


    【解决方案1】:

    我查看了您的数据,您的分隔符似乎是“;”而不是逗号。 在这种情况下,当您阅读 CSV 文件时,您应该指定分隔符。 使用:

    spark.read.option("delimiter", ";").csv(fileName)
    
    

    【讨论】:

      猜你喜欢
      • 2023-03-25
      • 2018-07-12
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-10-17
      相关资源
      最近更新 更多