【发布时间】:2017-08-23 18:24:18
【问题描述】:
我在使用 spark 编写的 hdfs 上有以下分区镶木地板数据:
year
|---Month
|----monthlydata.parquet
|----Day
|---dailydata.parquet
现在,当我从年份路径读取 df 时,触发读取 dailydata.parquet。我如何从所有分区中读取每月数据。我尝试使用设置选项 mergeSchema = true 会出错。
【问题讨论】:
标签: pyspark parquet pyspark-sql