【发布时间】:2017-09-15 13:03:08
【问题描述】:
我正在使用 PySpark 进行大数据分析。我可以使用以下命令导入存储在特定存储桶的特定文件夹中的所有 CSV 文件:
df = sqlContext.read.format('com.databricks.spark.csv').options(header='true', inferschema='true').load('file:///home/path/datafolder/data2014/*.csv')
(其中 * 类似于通配符)
我遇到的问题如下:
- 如果我想对 2014 年和 2015 年的数据进行分析,即文件 1 是
.load('file:///home/path/SFweather/data2014/*.csv'),文件 2 是.load('file:///home/path/SFweather/data2015/*.csv'),文件 3 是.load('file:///home/path/NYCweather/data2014/*.csv'),文件 4 是.load('file:///home/path/NYCweather/data2015/*.csv'),该怎么办?如何同时导入多个路径以获取一个数据帧?我是否需要将它们全部单独存储为数据框,然后在 PySpark 中将它们连接在一起? (您可以假设它们所有的 CSV 都具有相同的架构) - 假设现在是 2014 年 11 月。如果我想再次运行分析,但在“最新数据”上运行,例如dec14 什么时候是 2014 年 12 月?例如,我想在 12 月 14 日加载文件 2:
.load('file:///home/path/datafolder/data2014/dec14/*.csv'),并使用此文件:.load('file:///home/path/datafolder/data2014/nov14/*.csv')进行原始分析。有没有办法安排 Jupyter 笔记本(或类似笔记本)更新加载路径并导入最新运行(在这种情况下,“nov14”将被“dec14”替换,然后“jan15”等)。
我查看了之前的问题,但由于这是 AWS / PySpark 集成特定的问题,因此无法找到答案。
提前感谢您的帮助!
[背景:我已经获得了来自不同团队的许多 S3 存储桶的访问权限,这些存储桶包含各种大数据集。将其复制到我的 S3 存储桶,然后构建一个 Jupyter 笔记本似乎比直接从存储桶中提取数据并在其上构建模型/表/等并将处理后的输出保存到数据库中的工作要多得多。因此,我发布了上面的问题。如果我的想法完全错误,请阻止我! :)]
【问题讨论】:
标签: python amazon-s3 pyspark jupyter-notebook