【问题标题】:Redshift join with varchar(40) and 2.3 billions rowsRedshift join 与 varchar(40) 和 23 亿行
【发布时间】:2016-08-09 15:51:06
【问题描述】:

我是 Amazon Redshift 的新手。试图找出在 redshift 中加入两个表的最佳方法。
我有 1 个包含 23 亿条记录的表,id 列的数据类型为 varchar(40),带有排序键和 dist 键。
与在同一列 id 上具有 2300 万条记录的其他表进行左连接 - 排序键和分布键。
查询需要几个小时才能执行。我在这里做错了什么吗?

【问题讨论】:

    标签: amazon-redshift


    【解决方案1】:

    查看 STL_ALERT_EVENT_LOG 表是否有警报,您还可以在查询中使用“EXPLAIN”并检查您的查询是否通常使用最快的连接(合并连接)。您还应该识别具有数据倾斜或未排序行的表(请参阅 Redshift 文档)

    【讨论】:

    • 谢谢!我使用“解释”来确定使用的连接查询的类型,结果发现它使用的是哈希连接。执行真空,几乎花了 10 个小时,现在我在 5 分钟内得到结果。
    猜你喜欢
    • 2020-07-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-09-29
    • 2016-02-09
    • 1970-01-01
    • 2022-12-18
    • 2022-08-20
    相关资源
    最近更新 更多