【发布时间】:2021-03-08 20:36:07
【问题描述】:
有什么方法可以在单个 GPU 上执行 validation_step 方法,而在多个 GPU 上使用 DDP 执行 training_step。
我想要这样做的原因是因为我想要实现几个指标,这些指标需要完全访问数据,而在单个 GPU 上运行将确保这一点。我已经尝试过validation_step_end 方法,但不知何故我只得到了部分数据。那篇文章在这里:Stack Overflow Post
【问题讨论】:
有什么方法可以在单个 GPU 上执行 validation_step 方法,而在多个 GPU 上使用 DDP 执行 training_step。
我想要这样做的原因是因为我想要实现几个指标,这些指标需要完全访问数据,而在单个 GPU 上运行将确保这一点。我已经尝试过validation_step_end 方法,但不知何故我只得到了部分数据。那篇文章在这里:Stack Overflow Post
【问题讨论】:
恐怕这是不可能的。但是 TorchMetrics 包在开发时考虑到了多 GPU 支持,因此当您的 custom metric 源自 TM 时,您甚至可以在多 GPU 设置上运行。
【讨论】: