【问题标题】:Does map reduce gives the same performance as spark if there is only one map reduce job? [duplicate]如果只有一个 map reduce 作业,map reduce 是否提供与 spark 相同的性能? [复制]
【发布时间】:2017-10-12 00:48:42
【问题描述】:
大多数大数据作业没有一个 mapreduce 作业,因此通过将中间数据存储在内存中并避免在 HDFS 上复制来发挥作用。
我的问题是,如果只有一个 mapreduce 作业,比如 wordcount,该怎么办。 mapreduce 作业是否提供与 spark 相同的性能?如果不是,为什么?
这可能是一个普遍的问题,但我正在尝试深入了解 spark 的架构。
【问题讨论】:
标签:
apache-spark
mapreduce
bigdata
【解决方案1】:
根据this 论文,Spark 在字数上比 mapreduce 快 2.5 倍。他们将差异归因于更有效地将数据从 map 阶段路由到 reduce 阶段
字数统计
和类似的工作负载,其中地图输出选择性可以
使用地图端组合器、基于散列的聚合显着减少
在 Spark 中比基于排序的聚合更有效
MapReduce。执行时间分解结果表明
基于散列的框架贡献了大约 39% 的整体
Spark的改进