【问题标题】:spark strucuted streaming write errors火花结构化流式写入错误
【发布时间】:2018-06-17 10:28:47
【问题描述】:

我在消费和接收 kafka 消息时遇到了一些奇怪的错误。我正在运行 2.3.0,并且我知道这在其他版本中之前可以正常工作。

val event = spark.readStream.format("kafka")
.option("kafka.bootstrap.servers", <server list>)
.option("subscribe", <topic>)
.load()

val filesink_query = outputdf.writeStream
.partitionBy(<some column>)
.format("parquet")
.option("path", <some path in EMRFS>)
.option("checkpointLocation", "/tmp/ingestcheckpoint")
.trigger(Trigger.ProcessingTime(10.seconds))
.outputMode(OutputMode.Append)
.start 



java.lang.IllegalStateException: /tmp/outputagent/_spark_metadata/0 doesn't exist when compacting batch 9 (compactInterval: 10)

我很困惑,这是最新版spark的错误吗?

【问题讨论】:

    标签: apache-kafka spark-structured-streaming


    【解决方案1】:

    问题似乎与在 s3a 上使用 S3n 并且仅在 hdfs 而不是 s3 上具有检查点有关。这是非常烦人的罪,我想避免在我的代码中硬编码 dns 或 ips。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2021-05-31
      • 2020-08-18
      • 2021-01-03
      • 2020-02-25
      • 2017-10-01
      • 2020-06-21
      • 2018-07-12
      • 2019-06-08
      相关资源
      最近更新 更多