【发布时间】:2021-05-18 06:00:02
【问题描述】:
我有一个 Slurm 的作业队列配置,如下所示:
cluster = SLURMCluster(cores=20,
processes=2,
memory='62GB',
walltime='12:00:00',
interface='ipogif0',
log_directory='logs',
python='srun -n 1 -c 20 python',
)
当增加进程数时,每个工作人员获得的内存分配会减少。在我的工作流程开始时,这些任务是高度并行的,并且内存使用量很少。但是,流的结尾目前是串行的,需要更多的内存。除非我将进程设置为小(即 2 或 3),否则工作人员将“耗尽”内存并且 dask 将重新启动它(这会启动无限循环)。有足够的内存在单个节点上运行作业,我想有效地利用每个节点(最小化请求的总数)。
是否可以重新配置 cluster 以使工作流稍后在工作流中可用的内存更大?
【问题讨论】:
标签: dask dask-distributed dask-jobqueue