【发布时间】:2021-03-25 07:16:22
【问题描述】:
spark 在集群模式下运行是否必须使用分布式文件存储(HDFS/Cassandra/S3 等)?如果是,为什么?
Spark 是用于计算海量数据的分布式数据处理引擎。假设我有大量数据存储在 mysql 中,我想对其进行处理。 Spark 从 mysql 读取数据并在集群节点本身上执行内存(或磁盘)计算。我仍然无法理解为什么需要分布式文件存储才能在集群模式下运行 spark?
【问题讨论】:
-
如果你想要分布式 SQL 处理,你可以尝试 Presto 而不是 Spark
标签: apache-spark hadoop hdfs