【发布时间】:2020-09-30 01:33:59
【问题描述】:
首先,请允许我先说我对Spark-SQL 很陌生。
我正在尝试了解 Spark-Sql 中的各种联接类型和策略,我希望能够了解一种近似表(参与联接、聚合等)大小的方法,以便估计/通过了解幕后实际发生的情况来调整预期的执行时间,以帮助我选择最适合该场景的联接策略(在 Spark-SQL 中通过提示等)。
当然,表格行数提供了一个很好的起点,但我希望能够根据bytes/KB/MB/GB/TBs 来估计大小,以了解哪个表将/不适合内存等),这反过来又允许我通过选择最适合该场景的连接类型/策略等来编写更有效的 SQL 查询。
注意:我无权访问 PySpark。我们通过使用 Hive jdbc 驱动程序连接到 Glue 目录的 Sql Workbench 查询 Glue 表。
感谢任何帮助。
谢谢。
【问题讨论】:
标签: sql apache-spark-sql query-performance aws-glue