【问题标题】:repartition in spark streaming is taking more time?火花流中的重新分区需要更多时间吗?
【发布时间】:2020-03-04 10:02:53
【问题描述】:

我正在运行一个 Spark 应用程序,其中数据每 1 分钟输入一次。我正在做的重新分区数是 48。它在 12 个执行器上运行,4G 作为执行器内存和 executor-cores=4。

以下是流式批处理时间

在这里我们可以看到,有些批次大约需要 20 秒,而有些批次大约需要 45 秒

我进一步深入研究了其中一个花费更少时间的批次。下面是图片。

以及花费更多时间的那个。

在这里我们可以看到重新分区任务花费了更多时间,但上面的一个并没有花费太多时间来重新分区。每 3-4 批都会发生这种情况。数据来自kafka Stream,只有value,没有key。

spark配置有什么原因吗?

【问题讨论】:

    标签: apache-spark spark-streaming spark-streaming-kafka


    【解决方案1】:

    尝试减小“spark.sql.shuffle.partitions”的大小,默认值为 200,这有点过分了。降低值并分析性能。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-07-06
      • 2016-04-23
      • 1970-01-01
      • 1970-01-01
      • 2015-12-24
      相关资源
      最近更新 更多