【发布时间】:2019-01-04 06:52:49
【问题描述】:
我们在不同于 Cassandra 的一组节点上运行 Spark/Hadoop。我们有 10 个 Cassandra 节点和多个 Spark 核心,但 Cassandra 没有在 Hadoop 上运行。通过 spark(在 yarn 客户端模式下)从 Cassandra 获取数据的性能不是很好,并且从 HDFS 读取的批量数据更快(Cassandra 中为 6 分钟,HDFS 中为 2 分钟)。更改 Spark-Cassandra 参数也无济于事。
在 Cassandra 之上部署 Hadoop 会解决这个问题并严重影响读取性能吗?
【问题讨论】:
-
我从未听说过“Hadoop on Cassandra”。您的意思是“在 HDFS 上存储 Cassandra 数据”吗? Datastax 有自己的替代 CFS docs.datastax.com/en/dse/5.1/dse-dev/datastax_enterprise/…
-
我的意思是在同一个节点/集群上运行 Cassandra 和 spark/hadoop
标签: apache-spark hadoop cassandra