【发布时间】:2021-05-30 00:55:30
【问题描述】:
我正在使用AWS Glue 开发ETL 管道。所以我有一个csv 文件,它使用PySpark 以多种方式进行转换,例如重复列、更改数据类型、添加新列等。我在 S3 位置运行了一个带有数据存储的爬虫,所以它创建了 Glue根据给定的csv 文件的表。我的意思是当我在csv 文件中添加一个新列时,它会在运行爬虫时相应地更改 Glue Table。
现在我想对Amazon Redshift 做同样的事情,我想做的是在Redshift 中创建一个类似于我之前提到的Glue 表(使用csv 创建)的表。很多答案解释了手动创建 Redshift 模式。我也这样做了,但是当数据类型发生变化时,我必须手动更新它。当csv 文件更改时,Redhsift 表必须相应更新。
我可以使用爬虫来做同样的事情吗?我的意思是创建一个类似于 Glue 目录表的 Redhsift 表?因此,当数据类型更改或在csv 文件中删除或添加列时,我们可以运行爬虫,我们可以使用爬虫来做到这一点,还是有其他方法可以满足我的需要?这应该是一个完全自动化的 ELT 管道。
任何帮助将不胜感激!
【问题讨论】:
标签: amazon-web-services pyspark amazon-redshift etl aws-glue-data-catalog