【问题标题】:How to run mapreduce program on large number of files simultaneously?如何同时在大量文件上运行 mapreduce 程序?
【发布时间】:2017-11-11 16:57:22
【问题描述】:

我正在处理大型数据集并在其上运行 Mapreduce 程序。我可以轻松地在单个文件上运行 Mapreduce,其大小约为 3 GB。知道我想在所有文件上运行 mapreduce。是否有任何快捷方式或技术可以直接在所有文件上运行 mapreduce。 使用操作系统-Ubuntu Hadoop-2.7.1

【问题讨论】:

    标签: hadoop mapreduce


    【解决方案1】:

    如果您有所有可用的文件,请在 map-reduce 输入参数中指定目录/正则表达式来代替文件名。

    示例: bin/hadoop jar wc.jar WordCount /user/joe/wordcount/*.txt /user/joe/wordcount/output

    如果您不断获取文件并希望在文件到达时进行处理。 您必须一次又一次地运行 map-reduce 作业。因为它是批处理作业。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-12-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多