【发布时间】:2020-03-03 02:17:21
【问题描述】:
我在us-central1-a 有一个带有自定义 GPU 驱动的抢占式节点池的 kubeflow k8s 集群:
我在这些 GPU 节点上运行 kubeflow 笔记本服务器。
由于某些神秘的原因,节点在启动后很快(5-10 分钟)就会收到 compute.instances.preempted 消息:
为什么会这样?
【问题讨论】:
-
你看到这个有多久了?您是否对普通(非抢占式)实例尝试了相同的操作?
-
@night-gold 我经常看到它,有时是在节点创建后 10 分钟。笔记本服务器 pod 触发节点池自动缩放器,然后在短时间内节点被抢占。不可抢占的节点看起来没问题。
标签: kubernetes google-cloud-platform google-kubernetes-engine kubeflow