【发布时间】:2016-09-10 13:26:59
【问题描述】:
我有一组文件作为输入,每行格式化为一个 JSON 对象。然而,问题在于这些 JSON 对象上的一个字段是 JSON 转义字符串。示例
{
"id":1,
"name":"some name",
"problem_field": "{\"height\":180,\"weight\":80,}",
}
预计,当使用sqlContext.read.json 时,它将创建一个包含 3 列 id、name 和 question_field 的 DataFrame,其中 problem_field 是一个字符串。
我无法控制输入文件,我希望能够在 Spark 中解决这个问题,所以,有什么方法可以让 Spark 将该字符串字段读取为 JSON 并正确推断其架构?
注意:上面的 json 只是一个玩具示例,在我的例子中,problem_field 将具有可变的不同字段,Spark 可以很好地推断这些字段,而我不必对存在哪些字段做出任何假设。
【问题讨论】:
标签: json scala apache-spark spark-dataframe