【发布时间】:2020-02-09 08:34:30
【问题描述】:
在 ImageNet 数据集上训练 AlexNet 模型时,随着 GPU 数量的增加,我正在增加批量大小。当我收到 OOM 错误时,它可以正常工作到 4096。我从 4 个 GPU 上的批量大小为 1024 开始,然后在 8 个 GPU 上批量大小为 2048。但是,当我在 16 个 GPU 上尝试 4096 时,我得到了 OOM。理想情况下,这不应该发生,因为在数据并行性中,每个 GPU 的样本保持不变。我正在使用 ChainerMN 进行培训。
【问题讨论】:
标签: deep-learning chainer