【问题标题】:How to get a spark job's metrics?如何获得火花工作的指标?
【发布时间】:2016-03-12 10:37:00
【问题描述】:

我们有一个大约有 20 个节点的集群。该集群在许多用户和作业之间共享。因此,我很难观察自己的工作,以便获得一些指标,例如 CPU 使用率、I/O、网络、内存等......

如何获得工作级别的指标。

PS:集群已经安装了 Ganglia,但不知道如何让它在工作级别上工作。我想做的是监控集群使用的资源来执行我的工作。

【问题讨论】:

  • 不确定是否理解正确。您想直接从您的工作中获得不同的集群指标吗?或者您想知道您的工作使用了多少资源?
  • @maxteneff,对不起,如果我的帖子不清楚。我想知道我的工作使用了多少资源。
  • 我很好奇你最终做了什么来检索你的指标?
  • 你也可以在这里回答问题吗:stackoverflow.com/questions/49327187/…

标签: performance hadoop apache-spark ganglia


【解决方案1】:

您可以从 Spark History Server 获取 Spark 作业指标,该服务器显示以下信息:
- 调度程序阶段和任务列表
- RDD 大小和内存使用情况汇总
- A 环境信息
- 关于正在运行的执行者的信息

1、在启动 spark 应用程序之前将 spark.eventLog.enabled 设置为 true。这会将 Spark 配置为将 Spark 事件记录到持久存储。
2、设置spark.history.fs.logDirectory,这是包含历史服务器要加载的应用事件日志的目录;
3、启动历史服务器,执行:./sbin/start-history-server.sh

更多信息请参考以下链接:
http://spark.apache.org/docs/latest/monitoring.html

【讨论】:

    猜你喜欢
    • 2015-03-20
    • 1970-01-01
    • 2023-03-17
    • 1970-01-01
    • 2018-07-17
    • 1970-01-01
    • 1970-01-01
    • 2021-08-19
    • 1970-01-01
    相关资源
    最近更新 更多