【发布时间】:2020-11-21 23:39:53
【问题描述】:
我想在同一个 emr 集群中运行 2 个 spark 结构化流作业,以使用同一个 kafka 主题。两个作业都处于运行状态。但是,只有一项工作可以获取 kafka 数据。我对 kafka 部分的配置如下。
.format("kafka")
.option("kafka.bootstrap.servers", "xxx")
.option("subscribe", "sametopic")
.option("kafka.security.protocol", "SASL_SSL")
.option("kafka.ssl.truststore.location", "./cacerts")
.option("kafka.ssl.truststore.password", "changeit")
.option("kafka.ssl.truststore.type", "JKS")
.option("kafka.sasl.kerberos.service.name", "kafka")
.option("kafka.sasl.mechanism", "GSSAPI")
.load()
我没有设置 group.id。我猜两个工作中的相同组 id 被用来导致这个问题。但是,当我设置 group.id 时,它抱怨“用户指定的消费者组不用于跟踪偏移量。”。解决这个问题的正确方法是什么?谢谢!
【问题讨论】:
-
什么 Spark 版本? issues.apache.org/jira/browse/SPARK-26350
-
目前有什么进展吗?
-
我在 spark 3.0 中尝试了 kafka.group.id,但它没有达到我的预期。所以我提出一个新问题。 stackoverflow.com/questions/64003405/…
标签: apache-spark apache-spark-sql spark-streaming spark-streaming-kafka