【发布时间】:2015-04-19 13:58:46
【问题描述】:
我已将 Spark Streaming 配置为从 Kafka 接收数据,遵循 Kafka Integration Guide。
我将 Spark Streaming 的持续时间配置为 20 秒,并尝试将每 20 秒收到的消息保存到 HDFS,使用 DStream 方法saveAsTextFile
我成功运行了应用程序,它成功地从 Kafka 接收数据并每 20 秒将消息保存到 HDFS。但我对输出布局感到困惑。每隔20秒就会创建一个带有saveAsTextFile参数指定前缀的目录,其中包含一些带有前缀“part-”的输出文件,例如“part-00001”
但是,每个输出文件中只有一个消息内容。似乎 Kafka DStream 将收到的每条消息保存到 HDFS 中的单个输出文件中。我期待将多条消息保存到一个输出文件中。
顺便说一句,我正在使用 Spark Standalone 部署并且只有一名工作人员。
【问题讨论】:
-
您能否添加代码来重现您所面临的问题?
标签: apache-spark spark-streaming