【发布时间】:2018-09-17 21:15:23
【问题描述】:
我是 Python/PySpark 的新手,在我的 Mac 终端上使用之前无法清理数据。我想删除任何包含空值或重复行的行。我使用.distinct() 并尝试过:
rw_data3 = rw_data.filter(rw_data.isNotNull())
我也试过了……
from functools import reduce
rw_data.filter(~reduce(lambda x, y: x & y, [rw_data[c].isNull() for c in
rw_data.columns])).show()
但我明白了
"AttributeError: 'RDD' object has no attribute 'isNotNull'"
或
"AttributeError: 'RDD' object has no attribute 'columns'"
这清楚地表明我并不真正了解清理 DataFrame 的语法
【问题讨论】:
-
看起来你有一个
rdd而不是一个DataFrame。请尝试print(type(rw_data3))确定。
标签: python apache-spark pyspark apache-spark-sql rdd