【发布时间】:2016-08-05 18:48:27
【问题描述】:
我是新来的火花。我正在关注文档中的一些基本示例。
我有一个这样的csv文件:(简化版,真实的有近4万行)
date,category
19900108,apples
19900108,apples
19900308,peaches
19900408,peaches
19900508,pears
19910108,pears
19910108,peaches
19910308,apples
19910408,apples
19910508,apples
19920108,pears
19920108,peaches
19920308,apples
19920408,peaches
19920508,pears
这段 scala 代码可以很好地计算类别总数
val textFile = sc.textFile("sample.csv")
textFile.filter(line => line.contains("1990")).filter(line =>line.contains("peaches")).count()
textFile.filter(line => line.contains("1990")).filter(line => line.contains("apples")).count()
textFile.filter(line => line.contains("1990")).filter(line => line.contains("pears")).count()
遍历每一行的最佳方法是什么,按年份添加类别总数,以便我最终编写一个这样的 csv 文件:
date,apples,peaches,pears
1990,2,2,1
1991,3,1,1
1992,1,2,2
任何帮助将不胜感激。
【问题讨论】:
标签: scala csv apache-spark spark-dataframe