【问题标题】:How to detect in Hadoop cluster if any Datanode drive (Storage) failed如果任何 Datanode 驱动器(存储)失败,如何在 Hadoop 集群中检测
【发布时间】:2019-12-28 11:33:39
【问题描述】:

我正在尝试检测 Hadoop 集群中 Datanode 中的驱动器故障。 Cloudera Manager API 没有任何特定的 API。 CM API 仅与 Name node 或重启服务相关。这里有什么建议吗?非常感谢!

【问题讨论】:

  • 您有监控服务器的软件吗?例如,我希望您有某种监控软件可以从您的磁盘中检查smart messages。另请参阅Check for hard disk errors / signs of failure on CentOS Server(尽管这显然很大程度上取决于您的磁盘/监控解决方案/操作系统/您需要多快检测或预测它/...)
  • 不我们没有,也无法安装。我们必须开发一个脚本来推断 DataNode 中的磁盘故障并提醒支持团队。
  • 限制,例如您不能安装任何东西或您没有任何类型的监控,需要成为问题。否则,您只会让更多人建议您已经排除的内容。到目前为止,您尝试了哪些方法来获取此类信息?您使用什么操作系统?需要收集信息的用户是受限用户还是“root”用户?您需要多快检测故障?它多久发生一次?您能否在您的服务器上创建一个预期文件系统列表并将其与当前可用的文件系统进行比较?
  • 我已经建议了石墨 + grafana 的解决方案,但被拒绝了。我也担心不使用任何工具。我认为,他只对自定义解决方案感兴趣(不确定)。我在 Cloudera Manager API 中搜索以找到任何解决方案,但没有与磁盘故障相关的任何解决方案。一旦扣除任何故障,我需要立即发送邮件。磁盘未修复的平均发生率在弱时间为 1。

标签: python-3.x hadoop hadoop-yarn cloudera cloudera-manager


【解决方案1】:

如果您有权访问 NameNode UI,JMX 页面将为您提供此信息。如果你直接点击 JMX 页面,它将是一个 JSON 格式的页面,可以轻松解析。

我们主要使用 HortonWorks,很长时间没有接触 Cloudera,但我认为它可以通过某种方式提供。

【讨论】:

    猜你喜欢
    • 2015-11-22
    • 2022-12-22
    • 1970-01-01
    • 2012-10-15
    • 1970-01-01
    • 2010-09-14
    • 1970-01-01
    • 2023-03-09
    相关资源
    最近更新 更多