【发布时间】:2019-02-10 06:54:44
【问题描述】:
我有一个 Spark 集群,总共有 17 个执行器。我已将 Spark 2.1 与 Kafka 集成并从以下主题读取数据:
val df = spark
.readStream
.format("kafka")
.options("kafka.bootstrap.servers","localhost:9092")
.options("subscribe","test")
.load
现在我想知道,当我以集群模式提交我的 spark 应用程序时,将分配多少个执行程序(总共 17 个执行程序)来侦听 Kafka 主题并在结构化流中创建微批处理。
另外,从 Kafka 读取时,如何限制结构化流中微批量的大小?
【问题讨论】:
标签: apache-spark apache-kafka spark-structured-streaming