【发布时间】:2021-01-14 11:12:06
【问题描述】:
跟进this 问题和数据框,我正在尝试将数据框转换为字典。在熊猫中我使用的是这个:
dictionary = df_2.unstack().to_dict(orient='index')
但是,我需要将此代码转换为 pyspark。谁能帮我这个?正如我从之前的问题(例如this)中了解到的,我确实需要使用熊猫,但是数据框太大了,我无法做到这一点。我该如何解决这个问题?
编辑:
我现在尝试了以下方法:
dictionary_list = map(lambda row: row.asDict(), df_2.collect())
dictionary = {age['age']: age for age in dictionary_list}
(reference) 但它没有产生应有的效果。
在熊猫中,我得到的是以下内容:
【问题讨论】:
-
你的预期输出是什么?
-
@mck 我在问题中添加了一个打印屏幕
-
@mck 我在 pandas 中的整个过程的原始代码是这样的:dictionary = (value/value.groupby(level=0).sum()).unstack().to_dict(orient ='index'),指的是这个问题中的数据框:stackoverflow.com/questions/65707148/…
标签: pandas apache-spark dictionary pyspark apache-spark-sql