【发布时间】:2017-06-24 19:33:27
【问题描述】:
我们有一个Spark Streaming application 在 YARN 集群上运行。
它接收来自Kafka topics的消息。
其实我们的处理时间比批处理间隔要长。
Batch Interval : 1 Minute
Processing Time : 5 Minutes
我想知道,如果在处理时间之间接收到一些数据会发生什么,在处理结束之前内存中的数据是否可用。还是会在后续的数据抓取中被覆盖?
我们正在使用Direct Streaming approach 从 Kafka 主题中获取数据。
我应该使用Window based 操作吗?例如,如果我有Window length as 5 Minutes and Sliding interval as 2 Minutes and Batch Interval as 1 Minute,它会工作吗?因为我们不能丢失应用程序中的任何数据。
【问题讨论】:
标签: scala apache-kafka spark-streaming kafka-consumer-api