【发布时间】:2018-03-06 02:29:46
【问题描述】:
我将文件加载到数据框中,在将数据框保存到表中之前,我想检查数据框中的任何行是否已存在于表中。
例如 我的表有以下架构
A B C
1 2 3
2 4 5
我的数据框有以下内容
A B C
1 2 5
2 3 5
唯一性的定义是 A & B 列的组合。因此,在上面的示例中,重复条目是 (1, 2, 5),因为数据框和表都具有 (1, 2) 作为 A & B 的值。唯一记录是 (2,3,5),因为表没有 (2,3) 作为 A & B 的值。
所以我想要的输出是两个数据框。一个包含唯一的,即 (2,3,5),另一个包含重复的,即 (1,2,5)。
让我们将我当前的数据框称为 df1 并将表加载后的数据框称为 df2。
【问题讨论】:
-
这可以通过连接来解决。你有没有尝试过?
-
我试图加入但不知道除了功能。我试图在一次操作中完成所有操作。
标签: scala apache-spark