【问题标题】:apache pig rank operator not working with multiple reducerapache pig rank 运算符不使用多个减速器
【发布时间】:2014-06-25 21:11:54
【问题描述】:

我正在尝试使用 pig 的 rank 运算符为给定字符串分配整数。虽然当我将 parallel 子句设置为 1 时它有效,但它没有更高的值(如 200)。我需要使用多个reducer来加快处理速度,因为默认情况下,pig只使用一个reducer,这需要很长时间。

我的查询如下:

rank = 按 col1 ASC 并行 200 对 tupl1 进行排名;

【问题讨论】:

  • 请添加有关哪些不起作用的详细信息。如果有错误信息,你能显示出来吗?另外,您是否尝试使用少于 200 个减速器(例如 2 个)?

标签: hadoop hive apache-pig


【解决方案1】:

其实根据猪的文档(https://pig.apache.org/docs/r0.11.1/perf.html#parallel):

您可以将 PARALLEL 子句包含在任何以 减少阶段:COGROUP、CROSS、DISTINCT、GROUP、JOIN(内部)、JOIN (外部)和 ORDER BY。

这就是我认为你有错误的原因,无法为排名设置 PARALLEL 参数。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-01-01
    • 1970-01-01
    相关资源
    最近更新 更多