【问题标题】:Cassandra(with Hadoop) performance with Spark使用 Spark 的 Cassandra(使用 Hadoop)性能
【发布时间】:2019-01-04 06:52:49
【问题描述】:

我们在不同于 Cassandra 的一组节点上运行 Spark/Hadoop。我们有 10 个 Cassandra 节点和多个 Spark 核心,但 Cassandra 没有在 Hadoop 上运行。通过 spark(在 yarn 客户端模式下)从 Cassandra 获取数据的性能不是很好,并且从 HDFS 读取的批量数据更快(Cassandra 中为 6 分钟,HDFS 中为 2 分钟)。更改 Spark-Cassandra 参数也无济于事。

在 Cassandra 之上部署 Hadoop 会解决这个问题并严重影响读取性能吗?

【问题讨论】:

标签: apache-spark hadoop cassandra


【解决方案1】:

在不查看您的代码的情况下,在分析/Spark 容量中进行批量读取,在直接访问文件 VS 时总是会更快。从数据库中读取。该数据库提供了其他优势,例如架构实施、可用性、分发控制等,但我认为您看到的性能差异是正常的。

【讨论】:

    猜你喜欢
    • 2015-11-15
    • 2014-01-31
    • 2020-10-02
    • 2016-07-25
    • 2017-08-27
    • 2014-01-22
    • 2012-09-10
    • 2016-07-12
    • 2016-02-10
    相关资源
    最近更新 更多