【发布时间】:2014-08-22 03:50:17
【问题描述】:
我有一个大文本文件(以 TB 为单位),每一行都有一个时间戳和一些其他数据,如下所示:
时间戳1,数据 时间戳2,数据 时间戳5,数据 时间戳7,数据 ... 时间戳N,数据此文件按时间戳排序,但连续时间戳之间可能存在间隔。我需要填补这些空白并编写新文件。
这可以在 Hadoop Map Reduce 中完成吗?问这个问题的原因是为了插入缺失的行,我也需要上一行和下一行。例如。要插入 timestamp6,我需要 timestamp5 和 timestamp7 中的值。那么如果从 timestamp7 开始位于另一个数据块中,在这种情况下我将根本无法计算 timestamp6..
还有其他算法/解决方案吗?也许这不能用 mapreduce 来完成?我们可以在 RHADOOP 中做到这一点吗?
(Pig/Hive 解决方案也有效)
【问题讨论】:
标签: r hadoop mapreduce time-series interpolation