【问题标题】:Unload a table from redshift to S3 in parquet format without python script在没有 python 脚本的情况下,以镶木地板格式将表从 redshift 卸载到 S3
【发布时间】:2019-03-04 02:44:20
【问题描述】:

我发现我们可以使用 spectrify python 模块来转换 parquet 格式,但我想知道哪个命令将以 parquet 格式将表卸载到 S3 位置。

我发现我们可以使用复制命令将 parquet 格式的数据从 s3 加载到 redshift,https://docs.aws.amazon.com/redshift/latest/dg/r_COPY_command_examples.html#r_COPY_command_examples-load-listing-from-parquet

我们可以对从 redshift 卸载到 s3 做同样的事情吗?

【问题讨论】:

  • 你不能那样做,不过会很好!
  • 谢谢你,乔恩·斯科特。你有什么建议不用python脚本来做吗?
  • spectrify 是一个很棒的工具,它使这个过程非常轻松。从 csv 正确转换为 parquet 并非易事
  • 谢谢你,乔恩·斯科特。我会调查的。你能分享一下如何在python卸载脚本中使用spectrify的基本模型
  • pypi.org/project/spectrify 请参阅“按顺序执行所有 3 个步骤,本质上是在一个命令中“复制” Redshift 表 Spectrum。”

标签: amazon-web-services amazon-s3 amazon-redshift


【解决方案1】:

无需使用 AWS Glue 或第三方 Python 将 Redshift 数据以 Parquet 格式卸载到 S3。现在支持新功能:

UNLOAD ('select-statement')
TO 's3://object-path/name-prefix'
FORMAT PARQUET

文档可以在UNLOAD - Amazon Redshift找到

【讨论】:

    【解决方案2】:

    您是否考虑过 AWS Glue?您可以根据您的 Redshift 源创建 Glue 目录,然后转换为 Parquet。 AWS 博客供您参考,虽然它谈到将 CSV 转换为 Parquet,但您明白了。

    【讨论】:

    • 我会调查的
    • 感谢您接受我的回答。当您第一次尝试 AWS Glue 时,我还在博客中写了一些需要考虑的事情,因为在某些情况下文档有时缺少详细信息。网址如下:linkedin.com/pulse/…
    猜你喜欢
    • 2020-06-10
    • 2023-03-27
    • 2018-10-14
    • 2023-03-24
    • 1970-01-01
    • 1970-01-01
    • 2021-11-02
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多