【发布时间】:2018-09-21 05:04:24
【问题描述】:
读取 spark 数据帧并通过 Jupyter 笔记本和另一个进程同时写入 s3 存储桶来持久化它会不会有任何问题?
说,
我读了一个类似的数据框:
s3 = spark.read.parquet('s3://path/to/table')
然后在笔记本上做这件事。
同时,我在某个时候通过不同的进程写入同一个 s3 存储桶,例如
system('s3-dist-cp --src --dest s3://path/to/table)
这会成为一个问题吗?我可以搞乱读取/数据帧,但我不想阻止写入存储桶。
【问题讨论】:
标签: amazon-web-services apache-spark amazon-s3 amazon-emr bucket