【问题标题】:Missing Time Series data in HadoopHadoop 中缺少时间序列数据
【发布时间】:2014-08-22 03:50:17
【问题描述】:

我有一个大文本文件(以 TB 为单位),每一行都有一个时间戳和一些其他数据,如下所示:

时间戳1,数据 时间戳2,数据 时间戳5,数据 时间戳7,数据 ... 时间戳N,数据

此文件按时间戳排序,但连续时间戳之间可能存在间隔。我需要填补这些空白并编写新文件。

这可以在 Hadoop Map Reduce 中完成吗?问这个问题的原因是为了插入缺失的行,我也需要上一行和下一行。例如。要插入 timestamp6,我需要 timestamp5 和 timestamp7 中的值。那么如果从 timestamp7 开始位于另一个数据块中,在这种情况下我将根本无法计算 timestamp6..

还有其他算法/解决方案吗?也许这不能用 mapreduce 来完成?我们可以在 RHADOOP 中做到这一点吗?

(Pig/Hive 解决方案也有效)

【问题讨论】:

    标签: r hadoop mapreduce time-series interpolation


    【解决方案1】:

    虽然我的建议有点乏味,也可能会影响一点性能。您可以实现自己的 RecordReader 并在当前拆分的所有行的末尾,使用其块位置获取下一个拆分的第一行。我建议这样做是因为,如果任何映射器的最后一行不完整,hadoop 本身就会这样做。希望这会有所帮助!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2022-10-06
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-04-21
      • 2016-04-05
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多