【发布时间】:2018-04-03 18:28:10
【问题描述】:
这是我的 JSON
[
{"string":"string1","int":1,"array":[1,2,3],"dict": {"key": "value1"}},
{"string":"string2","int":2,"array":[2,4,6],"dict": {"key": "value2"}}
]
这是我的解析代码:
val mdf = sparkSession.read.option("multiline", "true").json("multi2.json")
mdf.show(false)
这个输出:
+---------------+---------+--------+----+-------+
|_corrupt_record|array |dict |int |string |
+---------------+---------+--------+----+-------+
|[ |null |null |null|null |
|null |[1, 2, 3]|[value1]|1 |string1|
|null |[2, 4, 6]|[value2]|2 |string2|
|] |null |null |null|null |
+---------------+---------+--------+----+-------+
为什么我有一个 _corrupt_record,一切看起来都正常? 为什么 dict 列只给出值而不给出键?
谢谢
【问题讨论】:
-
使用 multiLine insted of multiline。它有效。
标签: json scala apache-spark apache-spark-sql spark-dataframe