【问题标题】:High latency issue of online prediction在线预测的高延迟问题
【发布时间】:2020-03-02 18:01:58
【问题描述】:

我在 Google 机器学习引擎上部署了一个用于分类的线性模型,并希望使用在线预测来预测新数据。

当我使用 Google API 客户端库调用 API 时,大约需要 0.5 秒才能获得只有一个实例的请求的响应。我预计延迟应该小于 10 微秒(因为模型非常简单),而 0.5 秒太长了。我还尝试使用 predict_proba 方法对新数据进行离线预测。超过 100,000 个实例用了 8.2 秒,这比使用 Google ML 引擎要快得多。有没有办法可以减少在线预测的延迟?发送请求的模型和服务器托管在同一区域。

我想实时做出预测(API 收到请求后立即返回响应)。 Google ML Engine 是否适合此目的?

【问题讨论】:

  • 除了下面 Lak 的回答之外,如果您使用 --enable-logging 部署模型会很有帮助。日志包含一些每个请求的延迟信息(可在 StackDriver 日志中访问)。查看这些日志会很有帮助。
  • 我们很乐意帮助您确定延迟的来源。您介意将您的项目/模型/版本发送到 cloudml-feedback@。旁注:您可以通过在每个请求中包含多个实例来增加吞吐量(当前限制为 1.5 Mb 有效负载大小)。

标签: google-cloud-ml google-cloud-ml-engine


【解决方案1】:

更多信息会有所帮助:

  1. 你能测量从你正在访问服务的机器到 gcp 的网络延迟吗?如果您从部署模型的同一区域中的 Compute Engine 实例调用,则延迟最低。

  2. 你能发布你的电话代码吗?

  3. 这是第一个请求的延迟还是每个请求的延迟?

回答您的最后一个问题,是的,Cloud ml 引擎旨在支持每秒的高查询。

【讨论】:

    猜你喜欢
    • 2020-06-15
    • 1970-01-01
    • 1970-01-01
    • 2011-01-14
    • 2018-02-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多