【发布时间】:2018-05-30 20:44:41
【问题描述】:
我在每天创建的文件夹中有数据。
例如:以下是 AWS S3 中全年(2017 年)的数据文件夹格式,即 365 个文件夹
student_id=20170415
student_id=20170416
student_id=20170417
student_id=20170418
每个文件夹都有多个拼花格式的数据分区。
现在我只想读取过去 6 个月(180 天/180 个文件夹)的数据并在几列上执行一些逻辑。
如何将过去的 180 个文件夹读入单个数据框,我不想使用联合(即,不想将每天的数据文件夹分别读入每个单独的数据框,然后再将所有文件夹合并成巨型数据框,不,我不想那样做)。
我正在使用 Spark 2.0 和 Scala
【问题讨论】:
标签: scala apache-spark spark-dataframe