【问题标题】:How to loop through Hive Query and use loop variable如何遍历 Hive Query 并使用循环变量
【发布时间】:2018-01-20 03:42:04
【问题描述】:

假设我有两张桌子

External table - etable

Internal table - itable

我的 etable 是根据日期进行分区的。

现在要每天从 etable 的数据填充我的 itable,我有工作流和协调器在 Hive Query 中,如下所示:

ALTER TABLE etable ADD IF NOT EXISTS PARTITION (date = '${date}') LOCATION 'path/date=${date}';

INSERT OVERWRITE TABLE itable partition(date = '${date}') SELECT * FROM etable WHERE date = '${date}';

现在假设我每天都想更新过去n 天的数据,我该怎么做?

例如

让我们以n = 2 为例,如果协调器计划在今天运行,即2018-01-20(yyyy-MM-dd),那么它应该更新过去2 天的数据。所以查询应该更新2018-01-202018-01-19 的数据。所以基本上我需要以不同的日期运行上述查询两次。

有没有办法循环这个查询n 次并使用循环变量,因为这样我可以使用date_sub() 在每次循环迭代中获取不同的日期。或者有没有更好的办法?

谢谢。

【问题讨论】:

    标签: hadoop hive hiveql hue


    【解决方案1】:

    你应该可以做`

    INSERT OVERWRITE TABLE itable partition(`date`) 
    SELECT * FROM etable
    WHERE `date` BETWEEN datesub('${date}', ${n}) AND '${date}'
    

    无论如何,Hive 没有循环。 Hue 和 Oozie 也无法做到这一点,因为您正在尝试动态构建查询

    您执行此操作的方式需要使用 beeline -u jdbc:hive2://server:10000 --hivevar date="value" -f script.sql 的 bash 循环

    或者你可以使用 Python、Java 或任何你喜欢的东西来编写一个循环,只要它可以与 Hive 通信。

    然后,您可以使用 Oozie 安排该脚本/代码

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2013-06-23
      • 2016-01-14
      • 1970-01-01
      • 2019-01-07
      • 2015-07-04
      • 1970-01-01
      • 1970-01-01
      • 2015-06-09
      相关资源
      最近更新 更多