【发布时间】:2019-04-14 15:28:33
【问题描述】:
我使用Hadoop 来存储我的数据——对于一些我使用分区的数据,对于一些我不使用的数据。
我正在使用 pyspark DataFrame 类以 parquet 格式保存数据,如下所示:
df = sql_context.read.parquet('/some_path')
df.write.mode("append").parquet(parquet_path)
我想用pyspark 编写一个删除旧数据的脚本,使用类似的方式(我需要通过对数据框进行过滤来查询这些旧数据)。我在pyspark 文档中没有找到任何内容...
有没有办法做到这一点?
【问题讨论】:
标签: python python-3.x python-2.7 hadoop pyspark