【发布时间】:2021-05-17 01:07:41
【问题描述】:
假设我正在使用 Apache spark 读取这样的数据集:
City | Region | Population
A | A1 | 150000
A | A2 | 50000
B | B1 | 250000
C | C1 | 350000
在此基础上创建数据框后,假设我根据城市重新分区。现在如果我想知道我的spark集群的哪个节点有A市的信息,可以知道吗?如果是,请解释一下。
请教另一个问题,我如何知道 spark 作为数据帧读取的数据的总大小?
【问题讨论】:
标签: apache-spark hadoop apache-spark-sql hdfs hadoop-yarn