【问题标题】:Write same ORC data using Spark SQL and Hive, why Spark SQL file is 50% larger than hive?使用 Spark SQL 和 Hive 写相同的 ORC 数据,为什么 Spark SQL 文件比 hive 大 50%?
【发布时间】:2020-07-10 09:32:19
【问题描述】:

运行同样的sql,hive生成的文件是2.5G,spark sql生成的文件是4.1G。 我已将 spark.sql.orc.compression.codec 设置为我们在 hive 中使用的 zlib,并将 spark.sql.orc.impl 设置为 hive,我的 spark 版本是 2.4.0

【问题讨论】:

    标签: apache-spark apache-spark-sql orc


    【解决方案1】:

    对不起,我的问题不够清楚,因为 sql 很大,超过 500 行,而且是业务敏感的。

    无论如何,经过调查,我发现问题是由 MR/Spark shuffle 差异引起的:MR sort in reduce 而 Spark 没有。并且排序后的数据对游程编码非常友好。

    【讨论】:

      猜你喜欢
      • 2020-10-25
      • 2015-07-23
      • 2016-12-13
      • 2015-08-17
      • 2023-03-22
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-11-23
      相关资源
      最近更新 更多