【发布时间】:2016-11-30 16:43:24
【问题描述】:
我需要将 rdd 转换为两行,而不是 rdd 转换为一行。示例:
rdd1=a
b
我需要:
rdd2=(a,b)
如何在 pyspark 中执行此步骤? 这个问题可能很愚蠢,但我是新来的。 “更新” 这是在 rdd2 和 rdd3 之间执行笛卡尔运算,从 rdd1 开始。喜欢:
rdd3:(k,l)
(c,g)
(f,x)
我想要这个输出:
rddOut:[(a,b),(k,l)]
[(a,b),(c,g)]
[(a,b),(f,x)]
提前致谢
【问题讨论】:
标签: python apache-spark pyspark rows rdd