【发布时间】:2018-03-08 08:49:18
【问题描述】:
我在 s3 中有以下格式的目录,
<base-directory>/users/users=20180303/hour=0/<parquet files>
<base-directory>/users/users=20180303/hour=1/<parquet files>
....
<base-directory>/users/users=20180302/hour=<0 to 23>/<parquet files>
<base-directory>/users/users=20180301/hour=<0 to 23>/<parquet files>
....
<base-directory>/users/users=20180228/hour=<0 to 23>/<parquet files>
基本上我在日常目录中有每小时的子目录。
现在我想处理过去 30 天的 parquet 文件。
我已经尝试过,
val df = sqlContext.read.option("header", "true")
.parquet(<base-directory> + File.separator + "users" + File.separator)
.where(col("users").between(startDate, endDate))
endDate 和 startDate 相隔 30 天,格式为 yyyymmdd。
上述解决方案未提供正确的目录子集。我做错了什么?
【问题讨论】:
标签: apache-spark apache-spark-sql