【问题标题】:Understanding the metrics approach for Spark了解 Spark 的度量方法
【发布时间】:2020-07-27 18:00:04
【问题描述】:

我正在浏览 metric/monitoring 页面以获取 spark。

我的理解
Spark 按照spark.eventLog.enabled truespark.eventLog.dir hdfs://path 中的配置将事件写入事件日志。 这些可以通过 3 种方式访问​​

  1. Spark 历史服务器
  2. REST API
  3. SparkListener

我不明白的地方

  1. 您能否在 SparkListener 中获取 spark.eventLog.dir 中写入的所有事件日志?
  2. SparkMetrics 是否仅根据生成的 eventLogs 计算指标,还是这些指标集在 spark 事件日志中不可见?

【问题讨论】:

    标签: apache-spark metrics


    【解决方案1】:

    基础和派生指标存在 1) 在 Job 期间和 2) 可以持久化到 HDFS 以供后续使用,例如由历史服务器。

    • Spark 监听器 在 Spark 应用程序的生命周期内运行。它是一个侦听来自 Spark 的 DAGScheduler 的执行事件的类 - Spark 中执行引擎的主要部分。它不会从 spark.eventLog.dir 消耗;这可能甚至没有被spark-submit 等设置。
    • 第二个问题很难理解。在任何系统中总是有基本指标和派生的。如前所述,它们可能不是来自事件日志。鉴于指标可以显示为中值,那么它们也是派生出来的,也就是我怀疑的不同

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2017-04-14
      • 1970-01-01
      • 2018-02-09
      • 2017-07-04
      • 1970-01-01
      • 1970-01-01
      • 2016-12-26
      • 1970-01-01
      相关资源
      最近更新 更多