【发布时间】:2020-02-27 04:00:52
【问题描述】:
我可以消除多个值 i Column_3,Column_4
+--------+--------+--------+--------+
|Column_1|Column_2|Column_3|Column_4|
+--------+--------+--------+--------+
| 1| x| abc| www|
| 1| x| abc| sdf|
| 1| x| abc| xyz|
| 1| x| def| www|
| 1| x| def| sdf|
| 1| x| def| xyz|
+--------+--------+--------+--------+
预期输出
+--------+--------+--------+--------+
|Column_1|Column_2|Column_3|Column_4|
+--------+--------+--------+--------+
| 1| x| abc| www|
| 1| x| def| sdf|
| 1| x| null| xyz|
+--------+--------+--------+--------+
【问题讨论】:
-
试试
df.dropDuplicates(Array("Column_3"))。 -
嗨@Uservxn - 欢迎来到SO :) 几个问题: 1. 你的spark 版本是什么? 2. 是否有任何规则可以保留
Column_3和Column_4的组合,例如如何决定保留`abc | www` 或abc| sdf.
标签: scala apache-spark