【发布时间】:2019-01-31 11:33:36
【问题描述】:
我尝试了使用 tez 处理大数据(约 150GB)的过程(句子的单词标注),但问题是花了这么多时间(1 周或更长时间),然后
我试图指定映射器的数量。 虽然我设置了 mapred.map.tasks =2000, 但我无法停止将映射器设置为 150 左右, 所以我不能做我想做的事。
我在 oozie 工作流文件中指定映射值并使用 tez。
如何指定mapper的数量?
最后我想加快进程,不用tez也没关系。
另外,我想用reducer来统计标记的句子,太费时间了。
而且,我还想知道如何调整内存大小以使用每个映射器和减速器进程。
【问题讨论】:
-
mapred.map.tasks对 Tez 没有任何作用,因为它不是运行 MR Hive 引擎。另外,该属性已被弃用
标签: hadoop hive apache-tez