【发布时间】:2020-07-10 09:32:19
【问题描述】:
运行同样的sql,hive生成的文件是2.5G,spark sql生成的文件是4.1G。 我已将 spark.sql.orc.compression.codec 设置为我们在 hive 中使用的 zlib,并将 spark.sql.orc.impl 设置为 hive,我的 spark 版本是 2.4.0
【问题讨论】:
标签: apache-spark apache-spark-sql orc
运行同样的sql,hive生成的文件是2.5G,spark sql生成的文件是4.1G。 我已将 spark.sql.orc.compression.codec 设置为我们在 hive 中使用的 zlib,并将 spark.sql.orc.impl 设置为 hive,我的 spark 版本是 2.4.0
【问题讨论】:
标签: apache-spark apache-spark-sql orc
对不起,我的问题不够清楚,因为 sql 很大,超过 500 行,而且是业务敏感的。
无论如何,经过调查,我发现问题是由 MR/Spark shuffle 差异引起的:MR sort in reduce 而 Spark 没有。并且排序后的数据对游程编码非常友好。
【讨论】: