【发布时间】:2017-01-02 15:10:33
【问题描述】:
我有一个问题。在 Pyspark 中,当我们需要根据 (Key,Value) 获取总计 (SUM) 时,我们的查询如下所示:
RDD1 = RDD.reduceByKey(lambda x , y: x + y)
当我们需要找到 (Key,Value) 的 MAX / MIN 值时,我们的查询看起来像
RDD1 = RDD.reduceByKey(lambda x , y: x if x[1] >= y[1] else y)
为什么当我们对不使用x[1]、Y[1] 的数据求和时,MAX / MIN 也是如此?请澄清疑问。
Rgd 的
【问题讨论】:
标签: apache-spark pyspark