【发布时间】:2017-03-31 03:30:40
【问题描述】:
数据是两列,城市,我需要根据sum按城市分组。
表格看起来像这样(一百万次):
City, People
Boston, 1000
Boston, 2000
New York, 2500
Chicago, 2000
在这种情况下,波士顿将拥有 3000 人,排名第一。我需要返回前 5% 的城市及其人数(总和)。
最有效的方法是什么?熊猫可以很好地扩大规模吗?我应该跟踪前 5% 还是在最后进行排序?
【问题讨论】:
-
如果是
bigdata,你不认为你应该考虑使用pyspark吗?