【发布时间】:2016-05-21 17:33:38
【问题描述】:
我有一个格式为:(日期,城市)的 RDD。而里面的数据是这样的:
day1, city1
day1, city2
day1, city2
day2, city1
[...]
我需要获得每天“重复”最多的城市,即我需要以下结果:
day1, city2
day2, city1
day3, ...
你能帮我用 Python 怎么做吗?
我试着做一个简单的字数统计:
rdd.map(lambda x: (x[0], [1]. \
map(lambda y:y,1). \
reduceByKey(lambda a,b: a+b). \
takeOrdered(1, lambda s:-1*s[1]))).collect()
但是当然不行……
提前致谢。
【问题讨论】:
-
如果你知道 SQL 应该很容易。您能否请edit您的问题包括您尝试过的内容?
-
感谢 cricket_007 提供的 cmets,如果问题没有正确提出,我们深表歉意。
标签: python apache-spark rdd