【问题标题】:Deleting files from the Hadoop with pyspark (Query)使用 pyspark(查询)从 Hadoop 中删除文件
【发布时间】:2019-04-14 15:28:33
【问题描述】:

我使用Hadoop 来存储我的数据——对于一些我使用分区的数据,对于一些我不使用的数据。 我正在使用 pyspark DataFrame 类以 parquet 格式保存数据,如下所示:

df = sql_context.read.parquet('/some_path')
df.write.mode("append").parquet(parquet_path)

我想用pyspark 编写一个删除旧数据的脚本,使用类似的方式(我需要通过对数据框进行过滤来查询这些旧数据)。我在pyspark 文档中没有找到任何内容...

有没有办法做到这一点?

【问题讨论】:

    标签: python python-3.x python-2.7 hadoop pyspark


    【解决方案1】:

    Pyspark 主要是一个处理引擎。删除可以由raw python本身的subprocess模块处理。

    import subprocess
    
    some_path = ...
    subprocess.call(["hadoop", "fs", "-rm", "-f", some_path])
    

    【讨论】:

      猜你喜欢
      • 2020-10-05
      • 2013-05-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-05-23
      • 1970-01-01
      相关资源
      最近更新 更多