【发布时间】:2016-06-27 04:05:55
【问题描述】:
我在 HDFS 中有 3 个文件,我想使用最有效的方法先在第一列排序,然后在第二列排序,然后在 Spark 1.4 中使用 Scala(或 Python)将排序结果存储回 HDFS 上的新文件。 1:
hdfs:///test/2016/file.csv
hdfs:///test/2015/file.csv
hdfs:///test/2014/file.csv
文件看起来像这样(没有标题):
hdfs:///test/2016/file.csv
127,56,abc
125,56,abc
121,56,abc
hdfs:///test/2016/file.csv
126,66,abc
122,56,abc
123,46,abc
hdfs:///test/2016/file.csv
122,66,abc
128,56,abc
123,16,abc
排序后的输出要保存到 HDFS:
hdfs:///test/output/file.csv
121,56,abc
122,56,abc
122,66,abc
123,16,abc
123,46,abc
125,56,abc
126,66,abc
127,56,abc
128,56,abc
我对 Spark 很陌生,到目前为止我只知道如何加载文件:
val textFile = sc.textFile("hdfs:///test/2016/file.csv")
试图在互联网上阅读如何排序,但不清楚哪些库应该适用于这种情况(CSV 文件)和这个版本的 Spark(1.4.1)以及如何使用它们。 请帮忙,乔
【问题讨论】:
标签: python scala csv hadoop apache-spark