【发布时间】:2015-06-28 20:36:06
【问题描述】:
我需要能够从 RDD 中的 (key,value) 对返回值列表,同时保持原始顺序。
我在下面提供了我的解决方法,但我希望能够一次性完成所有操作。
类似:
myRDD = [(1, 2582), (3, 3222), (4, 4190), (5, 2502), (6, 2537)]
values = myRDD.<insert PySpark method(s)>
print values
>>>[2582, 3222, 4190, 2502, 2537]
我的解决方法:
myRDD = [(1, 2582), (3, 3222), (4, 4190), (5, 2502), (6, 2537)]
values = []
for item in myRDD.sortByKey(True).collect():
newlist.append(item[1])
print values
>>>[2582, 3222, 4190, 2502, 2537]
谢谢!
【问题讨论】:
标签: python sorting apache-spark rdd pyspark