【发布时间】:2018-11-28 21:02:24
【问题描述】:
如何使用 Apache Spark 和 Scala 对目录中存在的多个文件进行字数统计?
所有文件都有换行符。
O/p 应该是:
file1.txt,5
file2.txt,6 ...
我尝试使用以下方式:
val rdd= spark.sparkContext.wholeTextFiles("file:///C:/Datasets/DataFiles/")
val cnt=rdd.map(m =>( (m._1,m._2),1)).reduceByKey((a,b)=> a+b)
O/p 我得到了:
((file:/C:/Datasets/DataFiles/file1.txt,apple
orange
bag
apple
orange),1)
((file:/C:/Datasets/DataFiles/file2.txt,car
bike
truck
car
bike
truck),1)
我首先尝试了sc.textFile(),但没有给我文件名。
wholeTextFile() 返回键值对,其中键是文件名,但无法得到想要的输出。
【问题讨论】:
标签: scala apache-spark