【问题标题】:Increased Global Batch in Data Parallelism size Causes OOM Error数据并行大小的全局批处理增加导致 OOM 错误
【发布时间】:2020-02-09 08:34:30
【问题描述】:

在 ImageNet 数据集上训练 AlexNet 模型时,随着 GPU 数量的增加,我正在增加批量大小。当我收到 OOM 错误时,它可以正常工作到 4096。我从 4 个 GPU 上的批量大小为 1024 开始,然后在 8 个 GPU 上批量大小为 2048。但是,当我在 16 个 GPU 上尝试 4096 时,我得到了 OOM。理想情况下,这不应该发生,因为在数据并行性中,每个 GPU 的样本保持不变。我正在使用 ChainerMN 进行培训。

【问题讨论】:

    标签: deep-learning chainer


    【解决方案1】:

    终于想通了。不要在增加 GPU 数量时增加批量大小。如果您将批量大小设置为 32,则每个 GPU 的批量大小将为 32。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-03-19
      • 2015-11-20
      • 1970-01-01
      • 1970-01-01
      • 2023-03-18
      • 1970-01-01
      • 2017-05-06
      • 2015-08-31
      相关资源
      最近更新 更多