【发布时间】:2017-09-28 01:59:21
【问题描述】:
创建流式上下文时设置批处理间隔有什么作用
新的 StreamingContext(spark.sparkContext, batchInterval)
根据这个 Amazon blog,Kinesis 批处理间隔被硬编码为 1 秒。
【问题讨论】:
标签: spark-streaming amazon-kinesis
创建流式上下文时设置批处理间隔有什么作用
新的 StreamingContext(spark.sparkContext, batchInterval)
根据这个 Amazon blog,Kinesis 批处理间隔被硬编码为 1 秒。
【问题讨论】:
标签: spark-streaming amazon-kinesis
博客中提到的 Kinesis 批处理间隔是接收器从流中读取数据的间隔,默认设置为 1 秒。这个间隔只是决定接收器的输入速率。
在创建 StreamingContext 时提供的 batchInterval 将输入记录分成给定间隔的批次,由 Spark Streaming 处理。
例如,如果您有单个 Kinesis 接收器并且您的 batchInterval 为 10 秒,那么接收器将能够在 10 秒内读取多达 10000 条记录,即每秒从 Kinesis 流中读取 1000 条记录。因此,您的流式批处理将包含 10000 条记录。
【讨论】: