【问题标题】:Spark streaming textFileStream not processing the new files as RDDsSpark 流式传输 textFileStream 不将新文件作为 RDD 处理
【发布时间】:2015-07-12 18:18:47
【问题描述】:

我们有一个使用 Spark Streaming 1.4 构建的 java 应用程序,它每 20 秒轮询一次目录以查找新文件,还有另一个脚本每 5 秒填充新(无副本)文件。

问题是 - spark log 显示它已经拾取了新文件

2015-07-07 05:13:00,390 - [INFO ] org.apache.spark.streaming.dstream.FileInputDStream:59 New files at time 1436226180000 ms:
file:/home/mata/Downloads/in/365379649921050.txt
file:/home/mata/Downloads/in/365364610737285.txt
file:/home/mata/Downloads/in/365374642289893.txt
file:/home/mata/Downloads/in/365369640106263.txt
2015-07-07 05:13:00,918 - [INFO ] org.apache.spark.storage.MemoryStore:59 ensureFreeSpace(231040) called with curMem=0, maxMem=280248975

但是 RDD 处理(连接、聚合)没有发生。我在处理部分添加了日志语句,但它只在启动时显示这些语句一次。有人遇到过这个问题吗?

    // Create the context with a 20 second batch size
    SparkConf sparkConf = new SparkConf()
            .setAppName("Data - Streaming App");
    JavaStreamingContext ssc = new JavaStreamingContext(sparkConf,              
     Durations.seconds(Long.valueOf(args[3]).longValue()));

【问题讨论】:

  • 你能发布你的代码吗?

标签: apache-spark spark-streaming


【解决方案1】:

已解决。

这不是 Spark 问题。问题是我们正在读取平面文件并将其解析到单独的 java 类/对象中,但是此类中存在异常,Spark 出于某种原因没有记录该异常,并且没有默默地创建/处理任何 RDD。很难调试,但现在可以处理新文件了。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-03-16
    • 2015-07-08
    • 1970-01-01
    • 1970-01-01
    • 2014-12-18
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多