【发布时间】:2020-03-04 10:02:53
【问题描述】:
我正在运行一个 Spark 应用程序,其中数据每 1 分钟输入一次。我正在做的重新分区数是 48。它在 12 个执行器上运行,4G 作为执行器内存和 executor-cores=4。
以下是流式批处理时间
在这里我们可以看到,有些批次大约需要 20 秒,而有些批次大约需要 45 秒
我进一步深入研究了其中一个花费更少时间的批次。下面是图片。
以及花费更多时间的那个。
在这里我们可以看到重新分区任务花费了更多时间,但上面的一个并没有花费太多时间来重新分区。每 3-4 批都会发生这种情况。数据来自kafka Stream,只有value,没有key。
spark配置有什么原因吗?
【问题讨论】:
标签: apache-spark spark-streaming spark-streaming-kafka