【发布时间】:2018-02-21 16:09:43
【问题描述】:
我有一个格式为 (Group,[word1,word2,..wordn]) 的 RDD。它包含一个组和该组下的单词。如果我有以下输入
rdd=(g1,[w1,w2,w4]),(g2[w3,w2]),(g3[w4.w1]),(g3[w1,w2,w3]),(g2[w2])
我想收集一个单词在组中出现多少次的输出。输出格式为。
Word Group1 Group2 Group3
w1 1 0 2
w2 1 2 1
w3 0 1 1
w4 1 0 1
我可以使用哪些 pyspark 函数以最有效的方式实现此输出
【问题讨论】:
-
您所要求的可能可以通过转换为 DF 并调用
explode()和pivot()来完成。如果您提供了minimal reproducible example,那么您更有可能收到回复,以便人们可以轻松地重新创建您的数据。在此处查看更多信息:how to create good reproducible apache spark dataframe examples。
标签: apache-spark pyspark