【发布时间】:2019-06-24 20:58:40
【问题描述】:
我有一个带有日期列的数据框。我已将其解析为年、月、日列。我想对这些列进行分区,但我不希望这些列保留在 parquet 文件中。
这是我对数据进行分区和写入的方法:
df = df.withColumn('year', f.year(f.col('date_col'))).withColumn('month',f.month(f.col('date_col'))).withColumn('day',f.dayofmonth(f.col('date_col')))
df.write.partitionBy('year','month', 'day').parquet('/mnt/test/test.parquet')
这会正确创建镶木地板文件,包括嵌套文件夹结构。但是,我不希望 parquet 文件中包含年、月或日列。
【问题讨论】:
标签: python apache-spark pyspark databricks