【发布时间】:2020-09-16 04:50:41
【问题描述】:
我想了解一下,Spark 中的分区是什么?
我的理解是,当我们从一个源读取并放入任何特定的Datatset 时,那么该数据集可以拆分为多个sub-Datasets,那些sub-Datasets 被称为分区及其 upto spark framework where and how它分布在集群中。对吗?
当我阅读一些在线文章时,我产生了疑问,其中说
在后台,这些
RDDs or Datasets存储在 不同的集群节点。分区基本上是一个逻辑块 大型分布式数据集
这句话打破了我的理解。根据上述声明,RDDs or Datasets 位于分区内。但我认为 RDD 本身就是一个分区(拆分后)。
谁能帮我解开这个疑惑?
这是我的代码 sn-p,我从 JSON 读取数据。
Dataset<Row> ds = spark.read().schema(Jsonreadystructure.SCHEMA)
.json(JsonPath);
所以在阅读自身时,我如何将其拆分为多个分区?或任何其他方式?
【问题讨论】:
标签: java apache-spark