【问题标题】:Best practice for reading data from Kafka to AWS Redshift将数据从 Kafka 读取到 AWS Redshift 的最佳实践
【发布时间】:2019-01-06 18:31:04
【问题描述】:

将数据从 Kafka 集群移动到 Redshift 表的最佳做法是什么? 我们有连续的数据到达 Kafka,我想将其写入 Redshift 中的表(不一定是实时的)。

  • 我应该使用 Lambda 函数吗?
  • 我是否应该编写一个将在专用 EC2 实例上运行的 Redshift 连接器(消费者)? (缺点是我需要处理冗余)
  • 是否有一些 AWS 管道服务可以解决这个问题?

【问题讨论】:

    标签: amazon-web-services apache-kafka aws-lambda amazon-redshift


    【解决方案1】:

    Kafka Connect 通常用于将数据从 Kafka 流式传输到(和从)数据存储。它做一些有用的事情,比如自动管理横向扩展、故障转移、模式、序列化等等。

    This blog 展示了如何使用开源 JDBC Kafka Connect 连接器流式传输到 Redshift。还有一个community Redshift connector,不过这个我没试过。

    This blog 展示了另一种方法,不使用 Kafka Connect。

    免责声明:我为创建 JDBC 连接器的 Confluent 工作。

    【讨论】:

    • 感谢您的回复。这是否意味着我需要一个专用服务器来运行 Kafka Connect?
    • 从技术上讲,您可以在与经纪人相同的节点上运行它,但这通常是个坏主意。有一个reference architecture 可能会有所帮助。
    • @RobinMoffatt 你会推荐这种方法而不是下沉到 S3(使用 S3 连接器)并从 Redshift 摄取 avro 文件吗?
    • @JavierHolguera 我不知道。我将调查两个因素以确定这将是(a)您是否需要 S3 中的文件用于其他目的?如果是这样可能是更好的选择 (b) 直接从 JDBC 加载而不是登陆到 S3 然后摄取到 Redshift 的性能
    猜你喜欢
    • 2022-01-20
    • 2013-04-21
    • 2016-03-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-09-15
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多