【问题标题】:GCP - GPU staging time reductionGCP - GPU 分段时间减少
【发布时间】:2021-11-12 23:00:22
【问题描述】:

我有一个应用程序需要尽可能短的启动时间/TTL,并将 GPU 连接到 GCP CE 中的虚拟机。为了降低成本,我的基础架构依赖于在需求增加/减少时启动和停止实例。

我在没有 GPU 的情况下使用自定义图像实现了不到 5 秒的启动时间,但是一旦我连接了 GPU,“运行”的时间总是超过 20-30 秒。

我尝试了多个不同的发行版,清晰的 linux,预打包的 Nvidia 驱动程序映像,Fedora 的最小安装,最小化的 Debian,内核和用户空间的减少 - systemd-analyze 说我的启动时间是 3 秒,但是用 GPU 启动 VM运行前需要 20-30 秒的“STAGING”。

在 gpu 连接到 VM 时发生,并且在移除时 VM 在 systemd-analyze 提到的时间内启动。它在所有发行版和启动映像中都是一致的。

我是否缺少任何包或文档来加快连接 GPU 的暂存时间,或者这是 GCP 内部 GPU 实例暂存的限制?

非常感谢任何帮助或建议。

如果您也遇到此问题并想跟踪其进度,我创建了一个问题报告: https://issuetracker.google.com/issues/200575905

【问题讨论】:

    标签: google-cloud-platform gpu google-compute-engine boot


    【解决方案1】:

    这是 GCE 和 GKE 中的一个内部限制,目前没有太多可以解决的办法。
    但是,我注意到启动时间随着时间的推移而下降,因此在这件事上有一些改进。 您可以通过Public Issue Tracker 报告此情况以跟踪开发。

    您也可以考虑使用Committed Use DiscountSustained Use Discounts。从长远来看,保持实例运行可能是有益的,因此可以完全避免启动问题。

    【讨论】:

    • 感谢 Sergiusz,如果有任何问题,我会及时更新此页面。
    猜你喜欢
    • 1970-01-01
    • 2021-04-15
    • 1970-01-01
    • 2012-12-31
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-04-19
    相关资源
    最近更新 更多