【发布时间】:2021-12-12 20:12:28
【问题描述】:
我在 Apache Spark SQL 中有一个 DataFrame,我想删除所有非 None 值都相同的所有列。
所以在一个虚拟的例子中
df
| A | B | C |
1 2 3
NaN 2 4
1 2 NaN
1 2 5
我只想保留 C 列
df_filter
| C |
3
4
NaN
5
在 Python 中,我会按照以下方式进行操作
nunique = df.fillna(df.median()).nunique()
cols_to_drop = nunique[nunique == 1].index
df = df.drop(cols_to_drop, axis=1)
但是我将如何在 Apache Spark SQL DataFrame (Scala) 中做到这一点?
【问题讨论】:
标签: scala apache-spark apache-spark-sql