【发布时间】:2017-09-11 18:05:20
【问题描述】:
我是新手,所以请耐心等待。
我有一个 JSON 文件,其中每一行都有以下架构:
{
'id': 2,
'version': 7.3,
'participants': range(10)
}
participants 是一个嵌套字段。
input_file = 'data.json'
df = db.read_text(input_file).map(json.loads)
我可以:df.pluck(['id', 'version'])
或df.pluck('participants').flatten()
但我怎样才能做相当于 Spark 爆炸的操作,我可以同时选择 id、version 并展平 participants?
所以输出将是:
{'id': 2, 'version': 7.3, 'participants': 0}
{'id': 2, 'version': 7.3, 'participants': 1}
{'id': 2, 'version': 7.3, 'participants': 2}
{'id': 2, 'version': 7.3, 'participants': 3}
...
【问题讨论】:
-
为了完整起见,您能否输入您期望的输出,因为不是每个人都熟悉
explode。 -
你是对的@mdurant!我已经编辑了帖子
-
关于这个问题的任何更新?很想知道是否可以以这种方式使用 flatten