【发布时间】:2019-11-07 20:49:12
【问题描述】:
我已按以下结构向 S3 提交报告:
s3://chum-bucket/YYYY/MM/DD/UsageReportYYYYMMDD.zip
s3://chum-bucket/YYYY/MM/DD/SearchReportYYYYMMDD.zip
s3://chum-bucket/YYYY/MM/DD/TimingReportYYYYMMDD.zip
YYYY MM DD 每天都不同。文件名中的 YYYMMDD 存在是因为文件在移动到 S3 之前都进入了服务器上的一个目录。
我希望有 1 或 3 个爬虫,它们将 3 个表传送到目录中,每个表用于每种类型的报告。这可能吗?我似乎无法指定
s3://chum-bucket/**/UsageReport*.zip
s3://chum-bucket/**/SearchReport*.zip
s3://chum-bucket/**/TimingReport*.zip
我可以编写一个不包括 SearchReport 和 TimingReport 的爬虫,因此只爬取 UsageReport。这是最好的方法吗?
还是要彻底重新做bucket/文件夹/文件名设计?
【问题讨论】:
-
您打算如何使用这些文件?您会将它们与 Amazon Athena 或 Amazon Redshift Spectrum 一起使用吗?
-
使用 AWS Glue 读取文件并加载到 Redshift(不是 Redshift Spectrum)。
-
我的建议:重做你的设计,让每个文件夹都有兼容的数据
标签: amazon-web-services amazon-redshift aws-glue aws-glue-data-catalog