【问题标题】:etcd files in /var/lib/etcd/member/snap/var/lib/etcd/member/snap 中的 etcd 文件
【发布时间】:2018-12-09 03:08:08
【问题描述】:

我们的 kubernetes 集群最近因为 etcd “超出数据库大小”而崩溃。

我们成功地通过“简单”的 etcd 集群端点碎片整理 (see here) 将所有内容重新启动。

不幸的是,一切都不完美。 尤其是 etcd 端点的 /var/lib/etcd/member/snap 目录:

total 25G
-rw-r--r--. 1 etcd root   21K Jun 29 20:27 00000000000810cb-00000000066072bc.snap
-rw-r--r--. 1 etcd root   21K Jun 29 20:40 00000000000810cb-00000000066099cd.snap
-rw-r--r--. 1 etcd root   21K Jun 29 20:55 00000000000810df-000000000660c0de.snap
-rw-r--r--. 1 etcd root   21K Jun 29 21:19 000000000008113f-000000000660e7ef.snap
-rw-r--r--. 1 etcd root   21K Jun 29 21:37 0000000000081162-0000000006610f00.snap
-rw-------. 1 etcd root  916M Jun 29 15:40 000000000619e354.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:41 00000000061b9704.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:43 00000000061ca269.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:44 00000000061dbb43.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:47 00000000061e40df.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:48 00000000061e8192.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:49 00000000061f8799.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:49 0000000006200018.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:52 0000000006225cfd.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:53 00000000062323d6.snap.db
-rw-------. 1 etcd root  916M Jun 29 15:53 00000000062396fa.snap.db
-rw-------. 1 etcd root  970M Jun 29 15:54 000000000624dfe7.snap.db
-rw-------. 1 etcd root 1003M Jun 29 15:54 0000000006259f3f.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 15:58 0000000006296ff0.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 15:59 000000000629b9bc.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:01 00000000062b02c0.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:02 00000000062bef04.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:05 00000000062db8e2.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:09 00000000062ef4c4.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:11 00000000062fce7a.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:12 00000000063063c1.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:12 000000000630b648.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:12 000000000630bdbb.snap.db
-rw-------. 1 etcd root  1.2G Jun 29 16:13 000000000630e3f1.snap.db
-rw-------. 1 etcd root   27M Jun 29 21:41 db

这是唯一这样的端点,在这个端点上我们是低磁盘。

没有关于这些文件的文档,尤其是在我们的案例中如何减少整体磁盘占用空间(碎片整理/压缩/等已尝试)。

这些文件是什么? 如何减少这个端点的磁盘占用(摆脱那些巨大的 snap.db 文件)?

【问题讨论】:

    标签: kubernetes snapshot etcd


    【解决方案1】:

    随着时间的推移,它们似乎是您的 etcd 集群给定状态的snapshots

    听起来它们可以旋转。至少按照这个:

    etcdserver:清除旧的 snap.db 文件 #7967 https://github.com/coreos/etcd/pull/7967

    希望这个答案能有所帮助。

    【讨论】:

    • 完美。正是这种情况。并顺着问题的根源(Kubernetes 问题),在#7967 问题的开头解释了一切。删除了所有 .snap.db 一切都很好。谢谢 !还是不明白为什么 google 不给我推送这个。
    猜你喜欢
    • 2020-02-29
    • 2018-12-22
    • 2017-06-14
    • 2018-05-25
    • 2020-09-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多