【发布时间】:2020-02-26 10:20:58
【问题描述】:
我有一个 GCP 云计算 VM,它是一个 n1-standard-16,连接了 4 个 P100 GPU,以及一个用于存储数据的固态驱动器。我将其称为“虚拟机”。
我之前曾使用虚拟机来训练基于 TensorFlow 的 CNN。我想从这个转向使用 AI Platform,这样我就可以同时运行多个作业。但是我遇到了一些问题。
问题
在 VM 上运行训练时,我可以将批量大小设置为 400,完成一个 epoch 的标准时间约为 25 分钟。
当训练在complex_model_m_p100 AI平台机器上运行时,我相信它相当于VM,我可以设置最大batch size为128,一个epoch完成的标准时间是1小时40分钟。
差异:VM 与 AI 平台
VM 使用 TF1.12,AI Platform 使用 TF1.15。因此,GPU 驱动程序存在差异(CUDA 9 与 CUDA 10)。
VM 配备固态硬盘,我认为 AI 平台机器不是这样。
我想了解减少批量大小的原因,并将 AI Platform 上的 epoch 时间减少到与 Glamdring 相当的水平。有没有其他人遇到过这个问题?我是否在正确类型的 AI Platform 机器上运行?欢迎任何建议!
【问题讨论】:
-
AI Platform 默认提供常规的 100GB 永久磁盘,如果您访问本地磁盘上的数据集,可能会影响 IO 吞吐量。您能否在具有常规永久性磁盘的 GCE 虚拟机上尝试一下,看看这是否是瓶颈?
-
这不是编程问题,而是关于服务器配置的问题,应该在serverfault.com - What topics can I ask about here? 上询问
-
@GuoqingXu 记录在哪里,我很想知道。我有 1TB 的训练数据,我认为 AI Platform Training 不适合我,只是在容器启动时从 GCS 获取 18GB 的文件失败了 46%,它就放弃了。
-
您能否向 cloudml-feedback@google.com 发送一封描述问题的电子邮件?我们将确保这些问题得到解决。
标签: tensorflow google-cloud-platform google-cloud-ml gcp-ai-platform-training