【发布时间】:2014-06-26 17:34:34
【问题描述】:
Hadoop 新手在这里。我有一些像这样的用户事件日志,userid 和 timestamp 都是随机排序的:
userid timestamp serviceId
aaa 2012-01-01 13:12:23 4
aaa 2012-01-01 12:11:52 3
ccc 2012-01-03 08:13:07 3
bbb 2012-01-02 02:34:12 8
aaa 2012-01-02 01:09:47 4
ccc 2012-01-02 12:15:39 4
我想得到按 userid 和 timestamp 排序的中间结果,如下所示:
aaa 2012-01-01 12:11:52 3
aaa 2012-01-01 13:12:23 4
aaa 2012-01-02 01:09:47 4
bbb 2012-01-02 02:34:12 8
ccc 2012-01-02 12:15:39 4
ccc 2012-01-03 08:13:07 3
所以它可以很容易地被我的 Reducer 解析。
最终目标是计算用户在不同服务(serviceIds)上花费的时间。这可以使用 Python Hadoop 流实现吗?如果不是,那么您会建议什么更好的方法?非常感谢!
【问题讨论】:
标签: algorithm sorting hadoop mapreduce hadoop-streaming