【问题标题】:Hadoop version 1 vs version 2 performance [closed]Hadoop 版本 1 与版本 2 的性能 [关闭]
【发布时间】:2014-02-11 08:38:31
【问题描述】:

我计划从 Hadoop 版本 1 更新到 Hadoop 版本 2。谁能告诉我(如果您尝试过 hadoop 版本 2),版本 2 中的 MR /Hive/Pig 作业是否比版本 1 有任何性能改进?

【问题讨论】:

    标签: performance hadoop bigdata


    【解决方案1】:

    这是来自apache 的笔记。这些是改进的亮点。

    这里简要概述了 HDFS 和 MapReduce 的改进。

    HDFS 联盟 为了横向扩展名称服务,联邦使用多个独立的名称节点/名称空间。 Namenodes是联合的,即Namenodes是独立的,不需要相互协调。数据节点被所有名称节点用作块的公共存储。每个数据节点向集群中的所有名称节点注册。 Datanodes 定期发送心跳和块报告并处理来自 Namenodes 的命令。

    HDFS 联合文档中提供了更多详细信息。

    MapReduce NextGen 又名 YARN 又名 MRv2 hadoop-0.23引入的新架构,将JobTracker的两大功能:资源管理和作业生命周期管理划分为独立的组件。

    新的 ResourceManager 管理计算资源到应用程序的全局分配,每个应用程序的 ApplicationMaster 管理应用程序的调度和协调。

    应用程序要么是经典 MapReduce 作业意义上的单个作业,要么是此类作业的 DAG。

    ResourceManager 和每台机器的 NodeManager 守护进程管理该机器上的用户进程,形成计算结构。

    每个应用程序的 ApplicationMaster 实际上是一个特定于框架的库,其任务是从 ResourceManager 协商资源并与 NodeManager(s) 一起执行和监视任务。

    【讨论】:

    • 感谢您的回复。我阅读了 Hadoop v2 发行说明,发现了 YARN、MR2 和其他架构更改等新功能。我只需要知道是否有人将 v2 上的任何 MR/Hive/PIG 作业与 v1 进行比较并发现任何性能改进。
    猜你喜欢
    • 1970-01-01
    • 2019-12-30
    • 1970-01-01
    • 2019-06-25
    • 2010-11-11
    • 2019-12-30
    • 1970-01-01
    • 2010-12-09
    • 1970-01-01
    相关资源
    最近更新 更多