【发布时间】:2015-02-13 04:13:51
【问题描述】:
我在 S3 上存储了许多 gzip 压缩文件,每天按项目和小时组织,文件路径的模式如下:
s3://<bucket>/project1/20141201/logtype1/logtype1.0000.gz
s3://<bucket>/project1/20141201/logtype1/logtype1.0100.gz
....
s3://<bucket>/project1/20141201/logtype1/logtype1.2300.gz
由于要每天分析数据,我必须下载并解压缩属于特定日期的文件,然后将内容组装为单个 RDD。
应该有几种方法可以做到这一点,但我想知道 Spark 的最佳实践。
提前致谢。
【问题讨论】: