【问题标题】:confused with the FileSystemCounters about Job completion History in Hadoop与有关 Hadoop 中的作业完成历史的 FileSystemCounters 混淆
【发布时间】:2013-06-24 18:40:56
【问题描述】:

在 hadoop 的 Job completion History 中,我对一些 FileSystemCounters 感到困惑。

  1. FILE_BYTES_READ 和 HDFS_BYTES_READ 有什么区别。

  2. 为什么 HDFS_BYTES_READ 与 Map 输入字节的值不同?

  3. Spilled Records 和 Reduce 输出记录有什么区别?

【问题讨论】:

    标签: hadoop


    【解决方案1】:

    下面是解释 a) FILE_BYTES_READ - 当 Mapper 的输入来自本地文件时计算。通常为 0,但当 mapper 将文件作为中间输出发出时,会发生合并排序来合并文件。 mapper 中的 FILE_BYTES_READ 就是这样。

    b) HDFS_BYTES_READ - 对于映射器,它是来自 HDFS 的映射输入字节,包括有关拆分的元数据。 对于reducer,一般为0。

    c) 映射输入字节 - 映射器读取的输入字节的确切数量。通常,输入字节会比 HDFS_BYTES_READ 略少。

    d) 泄漏记录 - 对于 mapper 和 reducer,它是在作业执行期间溢出到磁盘的记录数

    e) 减少输出记录 - reducer 发出的最终记录数。

    【讨论】:

    • 我仍然对 FILE_BYTES_READ 感到困惑,你的意思是它总是与 Mapper 而不是 reducer 相关? @Magham Ravi
    猜你喜欢
    • 2017-08-10
    • 2020-01-15
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-06-26
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多