【发布时间】:2020-03-06 09:51:25
【问题描述】:
如何创建包含 2 个 JSON 文件的 pyspark 数据框?
- file1:这个文件有完整的数据
- file2:这个文件只有file1数据的schema。
文件1
{"RESIDENCY":"AUS","EFFDT":"01-01-1900","EFF_STATUS":"A","DESCR":"Australian Resident","DESCRSHORT":"Australian"}
文件2
[{"fields":[{"metadata":{},"name":"RESIDENCY","nullable":true,"type":"string"},{"metadata":{},"name":"EFFDT","nullable":true,"type":"string"},{"metadata":{},"name":"EFF_STATUS","nullable":true,"type":"string"},{"metadata":{},"name":"DESCR","nullable":true,"type":"string"},{"metadata":{},"name":"DESCRSHORT","nullable":true,"type":"string"}],"type":"struct"}]
【问题讨论】:
标签: apache-spark pyspark apache-spark-sql pyspark-dataframes