【发布时间】:2021-11-12 23:00:22
【问题描述】:
我有一个应用程序需要尽可能短的启动时间/TTL,并将 GPU 连接到 GCP CE 中的虚拟机。为了降低成本,我的基础架构依赖于在需求增加/减少时启动和停止实例。
我在没有 GPU 的情况下使用自定义图像实现了不到 5 秒的启动时间,但是一旦我连接了 GPU,“运行”的时间总是超过 20-30 秒。
我尝试了多个不同的发行版,清晰的 linux,预打包的 Nvidia 驱动程序映像,Fedora 的最小安装,最小化的 Debian,内核和用户空间的减少 - systemd-analyze 说我的启动时间是 3 秒,但是用 GPU 启动 VM运行前需要 20-30 秒的“STAGING”。
这仅在 gpu 连接到 VM 时发生,并且在移除时 VM 在 systemd-analyze 提到的时间内启动。它在所有发行版和启动映像中都是一致的。
我是否缺少任何包或文档来加快连接 GPU 的暂存时间,或者这是 GCP 内部 GPU 实例暂存的限制?
非常感谢任何帮助或建议。
如果您也遇到此问题并想跟踪其进度,我创建了一个问题报告: https://issuetracker.google.com/issues/200575905
【问题讨论】:
标签: google-cloud-platform gpu google-compute-engine boot