【发布时间】:2016-11-17 22:37:16
【问题描述】:
我有两个 RDD rdd1 和 rdd2
rdd1 = [(key1,value11), (key2,value12)]
rdd2 = [(key1, value21), (key3, value22)]
现在我将使用 rdd1 和 rdd2 进行内部连接,并提供这样的示例结果
rdd_join = [(key1,value11)]
在 sql 中会是这样的
SELECT rdd1.key,rdd1.value
FROM rdd1
INNER JOIN rdd2
WHERE rdd1.key = rdd2.key
有什么想法吗?
【问题讨论】:
-
如果你从你的 RDD 创建数据帧,你可以简单地做
val joined = df1.join(df2, $"df1Key" === $"df2Key", "inner")
标签: python apache-spark mapreduce hdfs rdd