【发布时间】:2020-03-02 18:01:58
【问题描述】:
我在 Google 机器学习引擎上部署了一个用于分类的线性模型,并希望使用在线预测来预测新数据。
当我使用 Google API 客户端库调用 API 时,大约需要 0.5 秒才能获得只有一个实例的请求的响应。我预计延迟应该小于 10 微秒(因为模型非常简单),而 0.5 秒太长了。我还尝试使用 predict_proba 方法对新数据进行离线预测。超过 100,000 个实例用了 8.2 秒,这比使用 Google ML 引擎要快得多。有没有办法可以减少在线预测的延迟?发送请求的模型和服务器托管在同一区域。
我想实时做出预测(API 收到请求后立即返回响应)。 Google ML Engine 是否适合此目的?
【问题讨论】:
-
除了下面 Lak 的回答之外,如果您使用 --enable-logging 部署模型会很有帮助。日志包含一些每个请求的延迟信息(可在 StackDriver 日志中访问)。查看这些日志会很有帮助。
-
我们很乐意帮助您确定延迟的来源。您介意将您的项目/模型/版本发送到 cloudml-feedback@。旁注:您可以通过在每个请求中包含多个实例来增加吞吐量(当前限制为 1.5 Mb 有效负载大小)。
标签: google-cloud-ml google-cloud-ml-engine