【发布时间】:2016-11-14 14:33:01
【问题描述】:
输入文件包含如下行(州、城市、人口):
west bengal,kolkata,150000
karnataka,bangalore,200000
karnataka,mangalore,80000
west bengal,bongaon,50000
delhi,new delhi,100000
delhi,gurgaon,200000
我必须用 Python 和 Scala 编写一个 Spark (Apache Spark) 程序才能找到人口最多的城市。输出将是这样的:
west bengal,kolkata,150000
karnataka,bangalore,200000
delhi,new delhi,100000
所以我需要为每个状态提供一个三列输出。我很容易得到这样的输出:
west bengal,15000
karnataka,200000
delhi,100000
但是要让城市拥有最大的人口变得越来越困难。
【问题讨论】:
-
在问题中包含您已经尝试过的内容(包括代码 sn-ps)总是有帮助的。
标签: apache-spark pyspark bigdata