【发布时间】:2022-01-09 10:12:27
【问题描述】:
我正在运行使用很少 GPU 内存的机器学习 (ML) 作业。 因此,我可以在单个 GPU 上运行多个 ML 作业。
为此,我想在 gres.conf 文件中添加多行来指定相同的设备。 但是,slurm 守护进程似乎不接受这一点,服务返回:
fatal: Gres GPU plugin failed to load configuration
我是否缺少任何选项来完成这项工作?
或者使用 SLURM 以不同的方式实现这一目标?
这有点像这个,但这个似乎特定于某些启用编译的 CUDA 代码。似乎比我的一般情况(或至少据我了解)更具体的东西。 How to run multiple jobs on a GPU grid with CUDA using SLURM
【问题讨论】:
标签: tensorflow gpu slurm