【发布时间】:2021-08-03 19:59:23
【问题描述】:
我最近开始在我的项目中使用 GCP,但在使用 Dataproc 集群中的 Jupyter 笔记本中的存储桶时遇到了困难。目前,我有一个包含一堆文件的存储桶,以及一个带有 Jupyter 笔记本的 Dataproc 集群。我要做的是检查存储桶中的所有文件并从中提取数据以创建数据框。
我可以使用以下代码一次访问一个文件:data = spark.read.csv('gs://BUCKET_NAME/PATH/FILENAME.csv'),但是有数百个文件,我无法为每个文件编写一行代码。通常,我会这样做:
import osfor filename in os.listdir(directory): ...
但这似乎在这里不起作用。所以,我想知道,如何在 Dataproc 集群中使用 Jupyter notebook 迭代存储桶中的文件?
不胜感激!
【问题讨论】:
标签: python google-cloud-platform jupyter-notebook google-cloud-storage google-cloud-dataproc