【问题标题】:Does map reduce gives the same performance as spark if there is only one map reduce job? [duplicate]如果只有一个 map reduce 作业,map reduce 是否提供与 spark 相同的性能? [复制]
【发布时间】:2017-10-12 00:48:42
【问题描述】:

大多数大数据作业没有一个 mapreduce 作业,因此通过将中间数据存储在内存中并避免在 HDFS 上复制来发挥作用。

我的问题是,如果只有一个 mapreduce 作业,比如 wordcount,该怎么办。 mapreduce 作业是否提供与 spark 相同的性能?如果不是,为什么?

这可能是一个普遍的问题,但我正在尝试深入了解 spark 的架构。

【问题讨论】:

    标签: apache-spark mapreduce bigdata


    【解决方案1】:

    根据this 论文,Spark 在字数上比 mapreduce 快 2.5 倍。他们将差异归因于更有效地将数据从 map 阶段路由到 reduce 阶段

    字数统计 和类似的工作负载,其中地图输出选择性可以 使用地图端组合器、基于散列的聚合显着减少 在 Spark 中比基于排序的聚合更有效 MapReduce。执行时间分解结果表明 基于散列的框架贡献了大约 39% 的整体 Spark的改进

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-03-08
      • 1970-01-01
      • 2021-05-21
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多