【发布时间】:2020-02-24 18:22:59
【问题描述】:
我有一个包含 5 个文件的 parquet 目录,如下所示:
我正在使用 Spark 2.2 版本并使用以下代码阅读此目录:
我不清楚为什么 Parquet 目录中有 5 个文件(每个文件都小于块大小)时 Spark 会确定 7 个分区(alternateDF.rdd().getNumPartitions())? 5 个任务有输入记录,但最后 2 个任务有 0 个输入记录,但输入数据非零。你能解释一下每个任务的行为吗?
【问题讨论】:
标签: apache-spark apache-spark-sql parquet hortonworks-data-platform