【发布时间】:2020-05-19 16:54:19
【问题描述】:
我正在 Jupyter Notebook 上使用 Python PySpark,我正在尝试删除“年龄”列中的所有空值。
我尝试了这两种方法,但没有一个有效:
new_df.na.drop(subset=["Age"])
new_df.dropna()
这是我目前正在使用的代码:
import pyspark.sql.functions as f
new_df = new_df.withColumn(
"Age",
f.when(
(f.col("Age") >= 0) &
(f.col("Age") <= 95), f.col("Age")).otherwise(f.lit(None))
)
new_df.dropna()
new_df.select('Age').distinct().show(1000, False)
我不确定我做错了什么或者没有删除空值的错误来自哪里,请告知我可以解决的问题。提前致谢
【问题讨论】:
-
new_df = new_df.dropna()
标签: python apache-spark pyspark apache-spark-sql pyspark-dataframes