【发布时间】:2019-03-14 06:46:58
【问题描述】:
我有数据框包含(大约 20000000 行),如果这些列具有相同的值,或者即使这些值的顺序相反,我想从数据框中删除两列的重复项。 例如原始数据框:
+----+----+----+
|col1|col2|col3|
+----+----+----+
| 1| 1| A|
| 1| 1| B|
| 2| 1| C|
| 1| 2| D|
| 3| 5| E|
| 3| 4| F|
| 4| 3| G|
+----+----+----+
其中列的架构如下:
root
|-- col1: string (nullable = true)
|-- col2: string (nullable = true)
|-- col3: string (nullable = true)
所需的数据框应如下所示:
+----+----+----+
|col1|col2|col3|
+----+----+----+
| 1| 1| A|
| 1| 2| D|
| 3| 5| E|
| 3| 4| F|
+----+----+----+
dropDuplicates() 方法如果值的顺序相同,则删除重复项
我遵循了这个问题的公认答案Pandas: remove reverse duplicates from dataframe,但花了更多时间。
【问题讨论】:
标签: pyspark