【问题标题】:Flink bucketing sink restart with save point cause data lossFlink bucketing sink 使用保存点重启导致数据丢失
【发布时间】:2021-07-30 18:56:45
【问题描述】:

我正在使用从 Kafka 到 HDFS 的 Flink bucketing sink。 Flink 的版本是 1.4.2。

我发现每次重新启动作业时都会丢失一些数据,即使使用保存点也是如此。

我发现如果我设置 writer SequenceFile.CompressionType.RECORD 而不是 SequenceFile.CompressionType.BLOCK 可以解决这个问题。似乎在 Flink 尝试保存检查点时,有效长度与实际长度不同,其中应该包括压缩数据。

但是,如果由于磁盘使用情况而无法使用 CompressionType.BLOCK,则可能会出现问题。如何在重新启动作业时使用块压缩来防止数据丢失?

这是 Flink 的已知问题吗?或者有谁知道如何解决这个问题?

【问题讨论】:

    标签: hadoop hdfs apache-flink


    【解决方案1】:

    不再推荐使用 Flink 的 BucketingSink。相反,社区建议使用 Flink 引入的 StreamingFileSink 1.6.0

    【讨论】:

    • 我想知道如果我使用StreamingFileSink会不会出现同样的问题。
    • 不,不应该有同样的问题。
    猜你喜欢
    • 2019-03-24
    • 2020-05-23
    • 1970-01-01
    • 1970-01-01
    • 2021-11-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多