【发布时间】:2013-10-19 06:56:38
【问题描述】:
详情如下:
输入文件在hdfs路径/user/rd/input,hdfs输出路径为/user/rd/output
在输入路径中,part-00000到part-19999有20000个文件,每个文件大约64MB。
我要做的是编写一个hadoop流作业,将这20,000个文件合并为10,000个文件。
有没有办法使用 hadoop 流作业将这 20,000 个文件合并为 10,000 个文件?或者换句话说,有没有办法控制hadoop流输出文件的数量?
提前致谢!
【问题讨论】: