【问题标题】:Slurm starting more jobs than I askSlurm 开始的工作比我要求的要多
【发布时间】:2016-04-09 18:36:34
【问题描述】:

我正在使用 slurm、OpenMPI 和 python(使用 MKL 的 anaconda)在多节点集群上运行作业。 当我提交作业时,一切似乎都按预期工作。但是,如果我登录到运行作业的节点之一并使用 htop 查看正在运行的进程,我会看到我启动的作业,并且对于每个作业,我都会看到另外 10 个“克隆”进程,它们占用与我开始的作业相同的内存但是 CPU 负载为 0(所有变化都是 PID 和 CPU(0%),其他一切都相同)。

谁能解释这种行为?

谢谢!

附: 这是我用来提交作业的批处理脚本:

#!/bin/zsh
#SBATCH --job-name="DSC on Natims"
#SBATCH -n 16
#SBATCH -N 8
#SBATCH --ntasks-per-node=2
#SBATCH --mem-per-cpu=20G
#SBATCH  --output="log_dsc%j.out"
#SBATCH  --error="log_dsc%j.err"
mpiexec -iface bond0 python dsc_run.py

【问题讨论】:

  • 可以添加你提交的脚本吗?

标签: python parallel-processing mpi slurm htop


【解决方案1】:

这些是程序启动的线程,因此它们是同一进程的一部分。在 htop 中按大写“H”切换进程线程的显示以查看差异。按 F2 查看设置菜单中的显示选项。您可以切换以也以不同的颜色显示线程。

【讨论】:

  • 谢谢,很有用!
  • 因为他们还没有跑完百分之一秒?
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2010-09-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2014-06-02
相关资源
最近更新 更多