【问题标题】:Copying data from redshift directly to EMR cluster -- Is it a good practice?将数据从 redshift 直接复制到 EMR 集群——这是一个好习惯吗?
【发布时间】:2018-08-13 18:53:22
【问题描述】:

Amazon 提供了一个非常详细的文档,用于将数据从 EMR 复制到 Redshift(通过 S3),但似乎没有任何相反的文档,这让我想知道加载数据是否是一个好习惯从红移到 EMR(直接,或通过某种介质)

理论上我不明白为什么不这样做,但我不知道它的后果

【问题讨论】:

  • 如果你有一个好的用例,那很好
  • 所以通常不建议这样做?
  • 不。如果需要,请执行此操作!可能有更好的方法,但您需要分享挑战的详细信息以获得帮助!
  • 为什么不使用AWS Glue?它在后台使用 EMR,但您不​​需要关心基础架构。此外,它与其他 AWS 服务(Redshift、s3 等)有很好的集成
  • @YuriyBondaruk 嗯,我得调查一下。不知道它存在.....

标签: amazon-redshift amazon-emr


【解决方案1】:

我认为您可以使用 Redshift Unload。 将数据导出为 Parquet,然后从 EMR Hadoop(Spark、Hive)中读取数据

UNLOAD ('select-statement')
TO 's3://object-path/name-prefix'
authorization
FORMAT PARQUET

https://docs.aws.amazon.com/redshift/latest/dg/r_UNLOAD.html

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2015-05-08
    • 2010-09-11
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-07-17
    • 1970-01-01
    相关资源
    最近更新 更多