【发布时间】:2013-10-18 21:04:14
【问题描述】:
我有一个问题.. 我有一个从 cassandra 获取输入的 mapreduce 程序。我的输入有点大,大约 100000000 个数据。我的问题是我的程序处理时间太长,但我认为 mapreduce 对于大量数据来说既好又快。所以我想也许我在 map 和 reduce 任务的数量上存在问题。我使用 JobConf、Job 以及 conf/mapred-site.xml 设置了 map 和 reduce 请求的数量,但我没有看到任何变化.. 在我的日志中,首先有地图 0% 减少 0%,经过大约 2 小时的工作,它显示地图 1% 减少 0%..!! 我该怎么办?请帮帮我,我真的很困惑......
【问题讨论】:
-
给我们一些更多的细节,没有这么多信息很难提供帮助。
-
我想用 mapreduce 处理大量数据。可能数据是 100000000,例如我想计算这些数据的平均值。但是处理时间太长了。我想知道我是否可以通过mapreduce快速运行这个过程。如果我可以增加地图的数量并减少任务来更快地完成这个过程。在下面的链接中,我读到这可能来自 Eclipse。你对此有什么想法吗? stackoverflow.com/questions/17298659/…
标签: hadoop mapreduce cassandra task