【发布时间】:2017-10-17 19:13:47
【问题描述】:
我们有一个使用 Spark 2.0 版的 MapR 集群 我们正在尝试测量当前在 TEZ 引擎上运行的 Hive 查询的性能差异,然后通过在 .hql 文件中编写 sql 查询然后通过 shell 文件调用它来在 Spark-sql 上运行它。
Query 包含大量的 Join,这肯定会创建多个阶段,并且在这种情况下会发生 shuffle 什么是最佳选择。?
Spark 中的数据集在执行 groupBy、max、min、count..etc 等聚合方面确实比 Dataframe 慢吗?
那么在哪些方面,Dataframes 比 Datasets 表现更好,反之亦然..?
【问题讨论】:
标签: apache-spark-sql spark-dataframe apache-spark-dataset apache-spark-2.0 databricks