【发布时间】:2019-01-28 16:00:48
【问题描述】:
我有一个包含以下列(Accident_Id、Date、Area)和数百行的 CSV 数据集。我想要实现的是按区域列分组到可能的唯一组中并找到每个组的计数。
我知道如何使用 SQLContext 做到这一点,但我不确定如何使用 JavaRDD 实现它以及它的操作(map、reduce 等...)
SparkConf conf = new SparkConf().setAppName("test").setMaster("local[2]");
JavaSparkContext sc = new JavaSparkContext(conf);
JavaRDD<String> data = sc.textFile(pathToCSV);
...
sqlContext.sql("SELECT COUNT(Area) FROM my_table GROUP BY Area").show();
【问题讨论】:
标签: java apache-spark rdd