【发布时间】:2020-05-11 11:32:08
【问题描述】:
由于 Apache Spark 是建议用于 Cassandra 的分布式处理引擎,我知道可以将 Spark 执行器与 Cassandra 节点一起运行。 我的问题是,驱动程序和 Spark 连接器是否足够聪明,能够理解分区和分片分配,从而以超融合的方式处理数据。
简单地说,执行器是否从托管在执行器运行的节点上的分区中读取存储的数据,这样就不会像 Spark 在 HDFS 上运行时那样通过网络传输不必要的数据?
【问题讨论】:
-
理论上是的。但实际上我在云上看到的较少,其中单独的节点用于 spark 和 Cassandra
标签: apache-spark cassandra spark-cassandra-connector