【问题标题】:How can I know the real-time memory usage of a running job on slurm?如何知道 slurm 上正在运行的作业的实时内存使用情况?
【发布时间】:2018-11-27 02:58:51
【问题描述】:

我对 cpu 如何与记忆进行通信知之甚少,所以我不确定这是否是一个“正确”的问题。

在我提交给 slurm 集群的作业脚本中,该脚本需要从存储在工作字典中的数据库中读取数据。我想监控运行这个脚本所使用的内存。

如何编写 bash 脚本来执行此操作?我试过@CoffeeNerd 的脚本。但是,在作业运行时,文件中只有一行输出

AveCPU|AveRSS|MaxRSS

如何修改此脚本以输出实时内存使用情况?

我知道sstat 命令,但我不确定sstat -j $JOBID.batch --format=MaxVMSize 之类的命令是否可以解决我的问题。

【问题讨论】:

    标签: slurm


    【解决方案1】:

    Slurm 有一个插件,可以将作业的“配置文件”(PCU 使用情况、内存使用情况等)记录到HDF5 文件中。它包含每个测量项目的时间序列。

    使用

    #SBATCH --profile=<all|none|[energy[,|task[,|filesystem[,|network]]]]>
    

    激活它。

    请参阅文档here

    【讨论】:

    • 我在哪里可以找到这个 HDF5 文件?
    • 这是由ProfileHDF5Dir配置参数决定的
    • 对,所以我假设在上面的命令中设置了一个默认值,因为它没有指定?
    • slurm.conf文件中定义
    猜你喜欢
    • 2018-01-12
    • 1970-01-01
    • 2015-04-09
    • 2012-04-28
    • 1970-01-01
    • 2010-10-21
    • 1970-01-01
    • 1970-01-01
    • 2013-12-10
    相关资源
    最近更新 更多