【问题标题】:Kafka Group coordinator 10.*.*.*:9092 (id: 2768927897 rack: null) is unavailable or invalid, will attempt rediscovery. Getting this error in consumerKafka Group coordinator 10.*.*.*:9092 (id: 2768927897 rack: null) 不可用或无效,将尝试重新发现。在消费者中收到此错误
【发布时间】:2022-01-04 11:54:49
【问题描述】:

消费者不断抛出此错误并每 5-10 秒重新平衡一次。

Group coordinator 10...*:9092 (id: 2147483646 rack: null) 不可用或无效,将尝试重新发现。

我已经尝试了所有可能的排序方法或此错误,但无法解决。 我可以删除 kakfa 日志并执行此操作,但这不是正确的方法。

【问题讨论】:

    标签: apache-kafka


    【解决方案1】:

    增加您的最大 CPU 核心使用率

    我在我们的生产环境中一直遇到这个问题。以下是我如何回溯并修复它。

    我这里用的是java spring,希望对你有帮助

    • 我们有一个消费者组,它使用 9 个不同的主题,每个主题有 10 个分区。 完全没有问题多年。直到开发增加了 2 个主题,然后问题仍然存在。
    • 我们的应用程序还处理 REST API,它查找我们存储在数据库中的使用数据。
    • 奇怪的是,我们在开发环境中对其进行了测试,即使在负载测试期间负载远远超过生产环境,也完全没有问题。
    • 我们注意到 dev 和 prod 之间的 cpu 核心限制存在差异,显然应用程序使用了很多核心。所以,我们在开发中测试了它,CPU 核心限制非常低,错误来了。
    • 我们终于在生产中增加了核心使用限制,然后问题不再出现。

    简而言之,消费者对 cpu 核心的使用方式超出了我们的预期。当应用程序尝试打开一个新的消费者时,由于缺少 cpu 核心,消费者失败。

    我不明白这个问题是,为什么 java-spring 中的 KafkaListener 没有抛出 OOM 错误,而不是在没有足够的 CPU 核心来打开新的消费者时杀死消费者。这样也许可以减少混乱。

    【讨论】:

      猜你喜欢
      • 2020-01-17
      • 2015-11-18
      • 1970-01-01
      • 1970-01-01
      • 2017-06-19
      • 2017-04-15
      • 1970-01-01
      • 2019-10-13
      • 1970-01-01
      相关资源
      最近更新 更多