【发布时间】:2019-07-20 20:44:54
【问题描述】:
我有一个包含以下两行的数据集
s.no,name,Country
101,xyz,India,IN
102,abc,UnitedStates,US
我试图转义每一列的逗号,但不是最后一列我希望它们相同并使用 spark-shell 获取输出。我尝试使用下面的代码,但它给了我不同的输出。
val df = sqlContext.read.format("com.databricks.spark.csv").option("header", "true").option("delimiter", ",").option("escape", "\"").load("/user/username/data.csv").show()
它给我的输出是
+----+-----+------------+
|s.no| name| Country|
+----+-----+------------+
| 101| xyz| India|
| 102| abc|UnitedStates|
+----+-----+------------+
但我希望输出如下所示我在这里缺少什么可以帮助我吗?
s.no name Country
101 xyz India,IN
102 abc UnitedStates,US
【问题讨论】:
-
您为什么不阅读两个字段并稍后连接?
-
@Shankar 对不起,我没听明白你能详细说明一下
标签: scala csv apache-spark apache-spark-sql