【问题标题】:Cogrouping Datasets in Pyspark在 Pyspark 中对数据集进行联合分组
【发布时间】:2021-01-04 22:20:30
【问题描述】:

我试图在 pyspark 中对两个数据集进行联合分组,但我不断收到“PipelinedRDD”对象不可迭代错误。我需要在共同分组之前对数据进行并行化吗?

PlayerRDD = dfPlayer.rdd.map(lambda x: [x["age"],(x[col1], x[col2], x[col3], x[col4], x[col5])])
CoachRDD = dfCoach.rdd.map(lambda x: [x["age"],(x[col1], x[col2], x[col3], x[col4])])
cogroupResults = PlayerRDD.cogroup(CoachRDD)
[(x, tuple(map(list, y))) for x, y in sorted(cogroupResults)]

【问题讨论】:

    标签: python dataframe pyspark google-colaboratory


    【解决方案1】:

    尝试这样做。

    cogroupResults = PlayerRDD.cogroup(CoachRDD)*.collect()*
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2022-10-14
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多