【发布时间】:2021-01-04 22:20:30
【问题描述】:
我试图在 pyspark 中对两个数据集进行联合分组,但我不断收到“PipelinedRDD”对象不可迭代错误。我需要在共同分组之前对数据进行并行化吗?
PlayerRDD = dfPlayer.rdd.map(lambda x: [x["age"],(x[col1], x[col2], x[col3], x[col4], x[col5])])
CoachRDD = dfCoach.rdd.map(lambda x: [x["age"],(x[col1], x[col2], x[col3], x[col4])])
cogroupResults = PlayerRDD.cogroup(CoachRDD)
[(x, tuple(map(list, y))) for x, y in sorted(cogroupResults)]
【问题讨论】:
标签: python dataframe pyspark google-colaboratory