【发布时间】:2019-06-21 14:44:58
【问题描述】:
我正在使用火花流,我想以 Avro 格式将每批火花流保存在我的本地。我使用 saveAsNewAPIHadoopFile 以 Avro 格式保存数据。这很好用。但它会覆盖现有文件。下一批数据将覆盖旧数据。有没有办法将 Avro 文件保存在公共目录中?我尝试通过添加 Hadoop 作业 conf 的一些属性来在文件名中添加前缀。但不能使用任何属性。
dstream.foreachRDD {
rdd.saveAsNewAPIHadoopFile(
path,
classOf[AvroKey[T]],
classOf[NullWritable],
classOf[AvroKeyOutputFormat[T]],
job.getConfiguration()
)
}
【问题讨论】:
标签: apache-spark spark-streaming avro hadoop2