【发布时间】:2014-06-26 06:19:54
【问题描述】:
在学习 Spark 的过程中,基本的工作流程似乎是转换 -> 动作,并将动作作为最终结果。
我有一个不同的工作流程,我对计算的最终结果不感兴趣,而是希望根据转换填充大量 Amazon S3 文件。 (想象一下进行大规模并行图像处理。)我想做这样的事情:
for each k,v:
v_ = transform(v)
make a new s3 file, with key = k, and contents = v_
【问题讨论】:
标签: amazon-s3 mapreduce apache-spark