【发布时间】:2015-10-19 08:14:20
【问题描述】:
如何在一项作业中使用 Python 和 Spark 为 RDD 中的每个键写入多个输出?我知道我可以尝试对所有可能的键使用 .filter,但这是很多工作,会创造很多工作。
类似于这个问题: Write to multiple outputs by key Spark - one Spark job
但是,上述问题的答案是在 scala 中。寻找如何使用 Python。
PATH = os.path.join("s3://asdf/hjkl", 'temp_date', "intermediate_data/")
global current_sport
current_sport = ''
def format_for_output(x):
current_sport = x[0]
return json.dumps(x[1])
recommendation2.map(format_for_output).saveAsTextFile(os.path.join(PATH, current_sport))
【问题讨论】:
-
API 很相似,应该很容易转译。
标签: python apache-spark pyspark