【发布时间】:2018-11-07 05:46:17
【问题描述】:
我有机会在具有 slurm 工作负载管理器的集群计算机上运行我的 Tensorflow 培训(该集群包含近 400000 个内核,40000 GB RAM,性能为 Rmax=500 TFlop/s 和 Rpeak=1000 TFlop/s,AMD GPU)。
我从事使用深度学习算法的图像处理项目。
我的问题是如何使用 slurm 作为工作负载管理器扩展我的 keras 深度学习以在该集群上运行?
【问题讨论】:
-
这取决于GPU的具体类型。您的瓶颈将是您的数据管道。所以仔细看看 tf.dataset。
-
我将使用 CPU 版本的 Tensorflow。在 MD GPU 上使用 Tensorflow 可能会很复杂。
-
但是我目前对keras比较熟悉。有没有可能使用keras。
-
Keras 没有任何分布式支持,最后因为 TF 是 Keras 的后端,所以这里只有 TF 重要。
标签: python tensorflow keras cluster-computing slurm