【发布时间】:2018-08-13 19:44:39
【问题描述】:
但是 csv 文件添加了额外的双引号,这导致所有 cloumns 成为单列
有四列,标题和两行
"""SlNo"",""Name"",""Age"",""contact"""
"1,""Priya"",78,""Phone"""
"2,""Jhon"",20,""mail"""
val df = sqlContext.read.format("com.databricks.spark.csv").option("header","true").option("delimiter",",").option("inferSchema","true").load ("bank.csv")
df: org.apache.spark.sql.DataFrame = ["SlNo","Name","Age","contact": string]
【问题讨论】:
-
请看this论坛帖子,上面说分隔符只能是单个字符长。因此,要么您需要自己指定架构,要么将其读取为 RDD 并清理记录并将其转换为 DataFrame。
标签: scala csv apache-spark dataframe apache-spark-sql