【发布时间】:2019-03-14 02:54:47
【问题描述】:
我正在尝试通过利用分区和下推等功能来优化一些 Spark 查询和 Parquet 模式。我的理解是这些技术允许跳过大部分 Parquet 文件。
有没有办法显示 Spark 读取的字节数与 Parquet 文件的总大小?另外,读取操作的数量? (我使用的是 S3,因此由于 S3 API 调用的开销,我想尽量减少读取操作的数量。)
【问题讨论】:
标签: apache-spark query-optimization parquet