【发布时间】:2011-02-01 07:13:19
【问题描述】:
我有一个包含 10 个节点的集群,所有这些节点都有相似的操作系统(ubuntu 10.4)。我想监控每个节点的性能,基本上在给定时间捕获 CPU、内存等。我怎样才能捕获相同的在每个节点上并聚合结果以获得组合结果示例整个集群的平均 CPU 使用率。
有什么命令我可以运行并得到结果。
提前致谢。
【问题讨论】:
标签: performance cluster-computing pbs
我有一个包含 10 个节点的集群,所有这些节点都有相似的操作系统(ubuntu 10.4)。我想监控每个节点的性能,基本上在给定时间捕获 CPU、内存等。我怎样才能捕获相同的在每个节点上并聚合结果以获得组合结果示例整个集群的平均 CPU 使用率。
有什么命令我可以运行并得到结果。
提前致谢。
【问题讨论】:
标签: performance cluster-computing pbs
您可以使用 pbsnodes 命令的输出来捕获此信息。如果你看状态:
status = rectime=1319751989,varattr=,jobs=,state=free,netload=904408724,gres=,loadave=0.63,ncpus=6,physmem=8193856kb,availmem=14823060kb,totmem=16581436kb,idletime=362, nusers=1,nsessions=15,sessions=1788 1171 19146 19183 19197 19207 19217 19282 19329 19553 19617 20238 20292 20535 20601,uname=Linux napali 2.6.378-12-generic #51-Sep-12-generic #51-4 UTC 2011 x86_64,opsys=linux
您可以在那里看到它具有计算机的平均负载,以及有关机器内存状态的几条信息。通过编写一些执行您正在寻找的计算的解析脚本,您可以解决您的问题。
【讨论】: