【发布时间】:2021-10-27 16:37:54
【问题描述】:
我在 AWS Athena 中的“TestDB”下创建了一些表。这些表是通过 S3 存储桶运行 AWS Glue 爬网程序创建的。我正在尝试通过在“TestDB”下加入 2 个现有表来创建一个新表。这是一个简单的左外连接,如下所示:
CREATE TABLE IF NOT EXISTS TestTab1
AS (
SELECT *
FROM (
(
SELECT col1, col2, col3, col4
FROM "TestDB"."tab1" a
WHERE a.partition_0 = '10-24-2021'
AND substring(a.datetimestamp, 1, 10) = '2021-10-24'
)
LEFT OUTER JOIN (
SELECT col1, col2, col3,col4
FROM "TestDB"."tab2" b
WHERE b.partition_0 = '10-24-2021'
AND substring(b.datetimestamp,1,10) = '2021-10-24'
)
ON (a.col1 = b.col1)
)
)
查询扫描了大约 5GB 的数据,但在大约 30 分钟后超时,因为这是超时限制。除了请求增加超时限制之外,还有其他方法可以在 AWS 上创建 2 个表的连接吗?
【问题讨论】:
-
也许使用 AWS Lambda? aws.amazon.com/pt/blogs/big-data/…
标签: amazon-web-services aws-glue amazon-athena