【问题标题】:Spark Streaming Real time integration with KafkaSpark Streaming 与 Kafka 的实时集成
【发布时间】:2018-05-05 21:17:15
【问题描述】:

我已将 Spark Streaming Process 与 Kafka 集成以读取特定主题。创建了轮询时间为 5 秒的 Spark 上下文,它工作正常。但是,如果我想实时访问提要,我可以将其进一步减少到 1 秒(它会超过杀死吗?)或者是否有其他更好的选择来处理这种情况。

【问题讨论】:

    标签: apache-spark spark-streaming


    【解决方案1】:

    Spark 结构化流提供了多种处理时间的模式或“触发器”。您可以通过使用连续处理模式牺牲吞吐量以减少延迟。您可以通过增加触发持续时间来牺牲延迟以获得更多吞吐量。您应该可以在 Scala 上将微批处理持续时间设置为 1 秒,在 Python 上设置为 2 秒。

    https://spark.apache.org/docs/latest/structured-streaming-programming-guide.html#triggers

    【讨论】:

      猜你喜欢
      • 2019-01-15
      • 2021-02-28
      • 2019-06-08
      • 2019-08-08
      • 2015-07-29
      • 1970-01-01
      • 1970-01-01
      • 2018-06-04
      • 2017-01-01
      相关资源
      最近更新 更多