【发布时间】:2015-07-12 18:18:47
【问题描述】:
我们有一个使用 Spark Streaming 1.4 构建的 java 应用程序,它每 20 秒轮询一次目录以查找新文件,还有另一个脚本每 5 秒填充新(无副本)文件。
问题是 - spark log 显示它已经拾取了新文件
2015-07-07 05:13:00,390 - [INFO ] org.apache.spark.streaming.dstream.FileInputDStream:59 New files at time 1436226180000 ms:
file:/home/mata/Downloads/in/365379649921050.txt
file:/home/mata/Downloads/in/365364610737285.txt
file:/home/mata/Downloads/in/365374642289893.txt
file:/home/mata/Downloads/in/365369640106263.txt
2015-07-07 05:13:00,918 - [INFO ] org.apache.spark.storage.MemoryStore:59 ensureFreeSpace(231040) called with curMem=0, maxMem=280248975
但是 RDD 处理(连接、聚合)没有发生。我在处理部分添加了日志语句,但它只在启动时显示这些语句一次。有人遇到过这个问题吗?
// Create the context with a 20 second batch size
SparkConf sparkConf = new SparkConf()
.setAppName("Data - Streaming App");
JavaStreamingContext ssc = new JavaStreamingContext(sparkConf,
Durations.seconds(Long.valueOf(args[3]).longValue()));
【问题讨论】:
-
你能发布你的代码吗?
标签: apache-spark spark-streaming