【发布时间】:2020-08-11 14:20:30
【问题描述】:
我只是想知道将 apache Cassandra 的数据存储到任何其他分布式文件系统的影响。
例如,假设我有 5 个节点的 Hadoop 集群和 3 的复制因子。
同样,对于 cassandra,我有 5 个集群节点,所有键空间的复制因子为 3。所有数据都将存储在具有相同挂载路径的 hdfs 位置。
例如-node-0 Cassandra数据目录-“/data/user/cassandra-0/”
和 Cassandra 的日志目录 - "/data/user/cassandra-0/logs/
有了这样的架构,我需要在以下几点上使用 cmets-
根据 datastax 文档中的建议,casaandra 数据和 commitlog 目录应该不同,在这种情况下这是不可能的。使用默认配置 cassandra 提交日志大小为 8192MB。所以根据我的理解,如果我有一个 1TB 的磁盘并且如果磁盘已满或任何磁盘级别错误将停止整个 cassandra 集群??
第二个问题与底层存储机制有关。通过为 hdfs 指定复制因子 3 和为 cassandra 指定复制因子 3 来进行两级数据分布,那么相同的数据(sstables)是否将存储在 9 个位置?严重的记忆丧失请就此提出建议?
【问题讨论】:
标签: kubernetes cassandra distributed-computing datastax cassandra-3.0