【问题标题】:Order of Mapper Combiner patitioner shuffle/sort映射器组合器分区器随机/排序的顺序
【发布时间】:2015-01-06 01:10:38
【问题描述】:

我在 Definite Guide: Hadoop in pg 206 中有以下文本。

在写入磁盘之前,线程首先将数据划分为对应的分区 到最终将被发送到的减速器。在每个分区内,后台线程按key进行内存排序,如果有combiner函数, 它在排序的输出上运行。运行组合器功能可以获得更多 紧凑的地图输出,因此写入本地磁盘和传输到本地磁盘的数据更少 减速机。

那么有了这样的理解,我可以将顺序排序为 Mapper、partitioner、shuffle/sort、Combiner 吗?

【问题讨论】:

    标签: hadoop


    【解决方案1】:

    我写了一篇关于这个的好文章:http://0x0fff.com/hadoop-mapreduce-comprehensive-description/ 一般来说,你是对的,但特别是有更多的极端情况 - 某些记录可能会省略组合器,其中一些记录可能会运行多次,甚至可以在减少端启动组合器减速机。所以总的来说你是对的,但事情要复杂得多

    【讨论】:

      猜你喜欢
      • 2015-03-08
      • 2012-11-19
      • 2016-04-15
      • 2014-03-18
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多