【发布时间】:2019-07-17 12:01:06
【问题描述】:
我有一个 pyspark 数据框,例如:
A B C
1 不适用 9
4 2 5
6 4 2
5 1 不适用
我想删除包含值“NA”的行。在这种情况下,第一行和最后一行。如何使用 Python 和 Spark 实现这一点?
根据评论更新: 寻找一种解决方案,在许多列中删除具有字符串的行:NA。
【问题讨论】:
-
NA 是什么意思?这对您来说是否意味着缺失值?还是在您的 DataFrame 中是这样的?在这种情况下,您的 B 列将是一个字符串!请确认。
-
NA 不是缺失值。这是一个字符串关键字。我想删除所有包含字符串“NA”的行。
-
此外,NA 也可以出现在另一列中,不一定在 B 列中,因此也应该删除该行。
-
是的,所以 spark 将它们标记为字符串,因为那里存在“NA”。我想删除“NA”,以便可以将列标记为整数。一种方法是在任何地方用 0 替换“NA”。我无法用正确的语法来实现它。
-
您应该添加一个最小示例以及到目前为止您已经尝试过的内容。一个简单的过滤器就可以完成这项工作
标签: apache-spark pyspark apache-spark-sql pyspark-sql