【发布时间】:2020-02-25 17:51:49
【问题描述】:
我在 S3 中有一个 Athena 数据表,它充当源表,其中包含 id、name、event 列。对于此表中的每个唯一 name 值,我想输出一个新表,其中包含与该 name 值对应的所有行,并保存到 S3 中的不同存储桶中。这将导致在 S3 中存储 n 个新文件,其中 n 也是源表中唯一 name 值的数量。
我在 Lambda 中使用 PARTITION BY 和 CTAS 查询尝试了单个 Athena 查询,但似乎无法获得我想要的结果。看来AWS Glue或许能达到我预期的效果,但我在网上看到它更贵,也许我可以使用Lambda获得预期的效果。
如何存储一个新文件(最好是 JSON 格式),其中包含对应于 S3 中每个唯一 name 的所有行?
我最好每天运行一次以更新name 存储的数据,但目前主要关注的是上述问题。
【问题讨论】:
标签: amazon-web-services amazon-s3 aws-lambda aws-glue amazon-athena