【发布时间】:2019-07-03 02:50:25
【问题描述】:
我有 2 个这样的数据框。 df1
+----+-------------+
|colA|colB |
+----+-------------+
| 1| "someval" |
| 2| "someval2"|
| 3| "someval3"|
df2
+----+-------------+
|colA|colC |
+----+-------------+
| 1| "someval" |
| 1| "someval2"|
| 2| "someval3"|
如果我进行内部连接 df1 和 df2(通过 colA),我会得到这个。
+----+-------------+----------+
|colA|colB |colC |
+----+-------------+----------+
| 1| "someval" |"someval" |
| 1| "someval" |"someval2"|
| 2| "someval2"|"someval3"|
但我只想要 colA 的不同行(因此,获取 colA 的顶行就足够了)
+----+-------------+----------+
|colA|colB |colC |
+----+-------------+----------+
| 1| "someval" |"someval" |
| 2| "someval2"|"someval3"|
【问题讨论】:
-
在 df2.select('colA').distinct() 下面给出的答案中,将不起作用,因为我需要显示所有 3 个列。我尝试了 dropDuplicates 函数(我不知道)并且它有效。所以如果您可以编辑答案以仅使用 dropDuplicates ,那么我将接受答案
标签: apache-spark-sql