【发布时间】:2023-03-30 08:35:01
【问题描述】:
我有一个 pyspark 数据框,其中列有时会具有与另一列匹配的错误值。它看起来像这样:
| Date | Latitude |
| 2017-01-01 | 43.4553 |
| 2017-01-02 | 42.9399 |
| 2017-01-03 | 43.0091 |
| 2017-01-04 | 2017-01-04 |
很明显,最后一个纬度值是不正确的。我需要删除任何和所有这样的行。我考虑过使用.isin(),但我似乎无法让它工作。如果我尝试
df['Date'].isin(['Latitude'])
我明白了:
Column<(Date IN (Latitude))>
有什么建议吗?
【问题讨论】:
标签: apache-spark pyspark spark-dataframe pyspark-sql