【发布时间】:2016-07-09 11:14:29
【问题描述】:
如何将 PySpark DataFrame 保存到真实的 JSON 文件?
按照文档,我已经尝试过
df.write.json('myfile.json')
它可以工作,但是它将文件保存为一系列字典,每行一个,并且不会被 a 正确读取
import json
d = json.load(open('myfile.json'))
我希望该文件包含一个字典列表。有什么办法吗?
【问题讨论】:
-
你试过
json.dumps(df.__dict__)吗? -
@TalesPádua
df只是分布式数据结构的接口。它的__dict__在这里没有任何有用的东西。
标签: python json apache-spark dataframe pyspark