【发布时间】:2020-08-21 00:21:03
【问题描述】:
我有一个这样的 pyspark 数据框:
+-----+---+-----+
| id| name|state|
+-----+---+-----+
|111| null| CT|
|222|name1| CT|
|222|name2| CT|
|333|name3| CT|
|333|name4| CT|
|333| null| CT|
+---+-----+-----+
对于给定的 ID,我想保留该记录,即使列“名称”为空,如果它的 ID 不重复,但如果 ID 重复,那么我想检查名称列并确保它在该 ID 中不包含重复项,并且如果“名称”为空,则仅针对重复的 ID 删除。以下是所需的输出:
+-----+---+-----+
| id| name|state|
+-----+---+-----+
|111| null| CT|
|222|name1| CT|
|222|name2| CT|
|333|name3| CT|
|333|name4| CT|
+---+-----+-----+
如何在 PySpark 中实现这一点?
【问题讨论】:
-
这可能是你正在寻找的python等效stackoverflow.com/questions/39982135/…
标签: apache-spark pyspark null apache-spark-sql pyspark-dataframes