【问题标题】:Vertex AI endpoint doesn't scale up / downVertex AI 端点不会放大/缩小
【发布时间】:2022-08-03 21:31:30
【问题描述】:

我一直在为 Vertex AI 部署一些自定义训练模型,但最近,自动缩放功能在后来的端点上无法正常工作。基本上,尽管有流量,端点不会自动缩放。

我有一个按预期工作的旧端点,所以我将相同的模型部署到具有相同配置的不同端点(相同的机器规格、相同的 GPU、最少 1 台机器、最多 3 台机器、60% 的自动缩放阈值),创建它自己的任务队列,然后同时向两个端点发送相同的请求。

较旧的端点按预期工作,根据传入的流量向上和向下扩展。另一方面,较新的机器一直卡在一台机器上。

我可以力量如果我将阈值降低到 15-20%,它会扩大规模,并且随着请求的进入它会扩大规模。但是,一旦完成处理请求,它就不会缩小规模,即使在几个小时没有任何交通。

那么,考虑到旧端点确实在相同流量下按预期扩展和缩减,是什么阻止了新端点随着流量的增加而扩展呢?也许更重要的是,如果我强迫它扩大规模,是什么阻止它缩小规模?

    标签: artificial-intelligence endpoint vertex


    【解决方案1】:

    我无法解释这两个端点的区别。

    Vertex AI 端点的自动缩放(默认情况下)基于您指定的机器类型的所有内核的 CPU 利用率。默认阈值 60% 表示所有内核上的 60%。对于 4 核机器,这意味着您需要 240% 的利用率才能触发自动缩放。

    我目前正在调试一个类似的问题,我怀疑 torchserve 是单线程的,并且只使用 4 核机器的一个核心。 Torchserve 有一些选项可能有助于它不是单线程的,但我还没有完成这些测试。我希望default_workers_per_model 对我的情况有所帮助。完整文档在这里:https://pytorch.org/serve/configuration.html

    您还应该检查您请求的任何 GPU 的配额使用情况,以确保这不是问题。

    我还没有解决这个问题,但希望上面的一些信息有所帮助。

    【讨论】:

      猜你喜欢
      • 2021-12-02
      • 2021-11-06
      • 2023-02-09
      • 2022-09-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-12-21
      相关资源
      最近更新 更多