【发布时间】:2019-06-25 19:42:28
【问题描述】:
我们正在尝试在没有 Hadoop 和 HDFS 之类的分布式存储的情况下在我们的项目中运行 Spark。 Spark 安装在具有 10 个内核和 16GB RAM 的单个节点上,该节点不属于任何集群。假设 Spark 驱动程序需要 2 个内核,其余内核在执行时由执行程序(每个 2 个)消耗。
如果我们将存储在 Spark 本地磁盘中的一个大 CSV 文件(大小为 1 GB)作为 RDD 处理并将其重新分区到 4 个不同的分区,执行程序会并行处理每个分区吗? 如果我们不将 RDD 重新分区为 4 个 diff 分区,执行程序会做什么? 如果不使用 HDFS,我们会失去分布式计算和并行性的力量吗?
【问题讨论】:
标签: apache-spark hadoop hdfs