【问题标题】:All GKE Cluster nodes restarted. How do we know the reason for the reboot?所有 GKE 集群节点都已重新启动。我们如何知道重启的原因?
【发布时间】:2022-12-15 08:55:21
【问题描述】:

我有一个版本为“1.22.12-gke.300”的 GCP GKE 集群。大约有 20 个节点分布在 4 个节点池中。该集群是在一个月前和最后一天创建的,我注意到我的所有节点都已重新启动/重新启动。当我使用命令 kubectl get nodes 查看节点的详细信息时,我看到了这个结果(如下)。所有节点的年龄都是 16 或 17 小时。

gke-company-name-gke-clust-company-name-default-n-97c8e50a-d63m   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-default-n-97c8e50a-l8zw   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-demo-app--d251216f-2uou   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-demo-app--d251216f-3mj1   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-demo-app--d251216f-doml   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-app--5ae07853-7mwd   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-app--5ae07853-gzxy   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-app--5ae07853-lgvo   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-27gf   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-7r4q   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-e680   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-m2vf   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-mtvg   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-mwiy   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-rwf9   Ready    <none>   16h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-tqe0   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-weai   Ready    <none>   17h     v1.22.12-gke.300
gke-company-name-gke-clust-company-name-prod-nifi-fd3e5533-xmss   Ready    <none>   16h     v1.22.12-gke.300

有什么方法可以确定重新启动/重新启动的原因。因为这次意外的重启导致我的系统出现了一些问题。我只是想确定这些重新启动的原因,以便我可以知道将来会发生这些类型的重新启动。

任何帮助表示赞赏。

【问题讨论】:

  • 您是否启用了自动升级。 ?您是在发布渠道中创建的集群吗?如果是,是哪一个?
  • 请检查此 stack link 解决您的问题

标签: kubernetes google-cloud-platform google-kubernetes-engine


【解决方案1】:

在 /var/log/messages 文件中查找日志条目。你会发现一些提示

【讨论】:

    【解决方案2】:

    我从上面的评论中收到了关于这个link 问题的答案。我只是解释一下让其他人受益的场景。

    我在 GKE 上创建了一个集群,发布渠道为“常规”。由于选择了这一点,GKE 将在发布新的安全或补丁更新时自动升级集群和节点。

    您可以使用此命令找到升级状态

    gcloud container operations list --filter="TYPE:UPGRADE_MASTER"
    

    【讨论】:

      猜你喜欢
      • 2023-01-26
      • 2022-12-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-11-06
      • 1970-01-01
      相关资源
      最近更新 更多