【发布时间】:2016-07-20 11:31:24
【问题描述】:
我有一个包含 3 个值的 RDD
rdd = rdd.map(lambda x: (x['Id'],[float(x['value1']),int(x['value2'])]))
我想找到并返回 value1 最大化的整个 RDD 我知道我能做到
rddMax = rdd.map(lambda x: (x['Id'], int(x['value1']))).reduceByKey(max)
然后再加入它,但我只想要一个干净的操作,找到按键分组的最大值 2,然后返回与这些值关联的整个 RDD。
我也不想在任何情况下将数据放入数据框中
谢谢
【问题讨论】:
标签: python apache-spark mapreduce pyspark rdd