【发布时间】:2020-12-09 00:17:09
【问题描述】:
在 Hive 中,如果我们调用 limit 子句,它将给出更快的响应。同样,如果我们在 Spark SQL 中运行,它会花费更多时间。能不能详细解释一下?
在蜂巢中
SELECT * FROM employee LIMIT 10;
在 Spark SQL 中,
spark.sql("SELECT * FROM employee LIMIT 10").show()
限制查询如何作用于分区表?
【问题讨论】:
-
你能告诉我这两种情况下的文件格式是什么吗?
-
文件格式是拼花
-
您使用的是哪个 Hive 和 Spark 版本?在 hive 中运行相同查询时您使用的是哪个执行引擎?
-
如果我们运行任何 spark/hive 版本,对于 select * from table limit 10,hive 将提供更好的性能,因为 hive 将直接从 hdfs 文件运行。
-
我想要的是使用限制查询时 spark 和 hive 的内部工作。
标签: apache-spark hive apache-spark-sql