【发布时间】:2015-08-20 20:15:53
【问题描述】:
Spark SQL 是否包含针对连接的表流式优化,如果包含,它如何决定要流式传输哪个表?
在进行连接时,Hive 假定最后一个表是最大的表。作为一种连接优化,它将尝试缓冲较小的连接表并将最后一个连接表流过。如果连接列表中的最后一个表不是最大的,Hive 有 /*+ STREAMTABLE(tbl) */ 提示,告诉它应该流式传输的表。从 v1.4.1 开始,Spark SQL 不支持 STEAMTABLE 提示。
已针对 Spark SQL 之外的正常 RDD 处理提出此问题,here。答案不适用于开发人员无法控制显式缓存操作的 Spark SQL。
【问题讨论】:
标签: apache-spark apache-spark-sql