【发布时间】:2018-05-05 21:17:15
【问题描述】:
我已将 Spark Streaming Process 与 Kafka 集成以读取特定主题。创建了轮询时间为 5 秒的 Spark 上下文,它工作正常。但是,如果我想实时访问提要,我可以将其进一步减少到 1 秒(它会超过杀死吗?)或者是否有其他更好的选择来处理这种情况。
【问题讨论】:
标签: apache-spark spark-streaming
我已将 Spark Streaming Process 与 Kafka 集成以读取特定主题。创建了轮询时间为 5 秒的 Spark 上下文,它工作正常。但是,如果我想实时访问提要,我可以将其进一步减少到 1 秒(它会超过杀死吗?)或者是否有其他更好的选择来处理这种情况。
【问题讨论】:
标签: apache-spark spark-streaming
Spark 结构化流提供了多种处理时间的模式或“触发器”。您可以通过使用连续处理模式牺牲吞吐量以减少延迟。您可以通过增加触发持续时间来牺牲延迟以获得更多吞吐量。您应该可以在 Scala 上将微批处理持续时间设置为 1 秒,在 Python 上设置为 2 秒。
https://spark.apache.org/docs/latest/structured-streaming-programming-guide.html#triggers
【讨论】: