【发布时间】:2020-01-04 16:43:25
【问题描述】:
在 Spark 中,当我们读取使用 partitionBy 或 bucketBy 写入的文件时,spark 如何识别它们属于这种类型(partitionBy/bucketBy),从而使读取操作变得高效? 有人可以解释一下。提前致谢!
【问题讨论】:
-
分区仅由子目录
/year=2020/month=01/标识,并在扫描文件夹结构时发现。桶是分区下的集群,请参阅pruning buckets 了解 Spark 如何发现分桶列。