【问题标题】:keras (tensorflow backend) run on a cluster using slurmkeras(张量流后端)使用 slurm 在集群上运行
【发布时间】:2018-11-07 05:46:17
【问题描述】:

我有机会在具有 slurm 工作负载管理器的集群计算机上运行我的 Tensorflow 培训(该集群包含近 400000 个内核,40000 GB RAM,性能为 Rmax=500 TFlop/s 和 Rpeak=1000 TFlop/s,AMD GPU)。

我从事使用深度学习算法的图像处理项目。

我的问题是如何使用 slurm 作为工作负载管理器扩展我的 keras 深度学习以在该集群上运行?

【问题讨论】:

  • 这取决于GPU的具体类型。您的瓶颈将是您的数据管道。所以仔细看看 tf.dataset。
  • 我将使用 CPU 版本的 Tensorflow。在 MD GPU 上使用 Tensorflow 可能会很复杂。
  • 但是我目前对keras比较熟悉。有没有可能使用keras。
  • Keras 没有任何分布式支持,最后因为 TF 是 Keras 的后端,所以这里只有 TF 重要。

标签: python tensorflow keras cluster-computing slurm


【解决方案1】:

使用 Horovod 扩展 Keras 训练 - https://github.com/uber/horovod

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-05-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多