【问题标题】:Oozie/Hadoop: How do I define an input dataset when it's more complex than just a static file?Oozie/Hadoop:当输入数据集比静态文件更复杂时,如何定义它?
【发布时间】:2013-04-24 08:21:08
【问题描述】:

我正在尝试使用 Oozie 运行现有的 Hadoop 作业(我正在从 AWS 迁移)。

在 AWS Mapreduce 中,我以编程方式提交作业,因此在提交作业之前,我的代码以编程方式查找输入。

我的输入恰好是另一个作业的最后一次成功运行。要找到最后一次 SUCCESSFUL 运行,我需要扫描一个 HDFS 文件夹,按文件夹命名约定中嵌入的时间戳排序,然后找到其中包含 _SUCCESS 文件的最新文件夹。

如何做到这一点超出了我的 oozie-newbie 的理解范围。

有人可以简单地为我描述一下我需要在 Oozie 中配置什么,以便我了解我在这里尝试达到的目标吗?

【问题讨论】:

    标签: hadoop mapreduce oozie


    【解决方案1】:

    看看 oozie 的以下配置:https://github.com/cloudera/cdh-twitter-example/blob/master/oozie-workflows/coord-app.xml

    有一个名为“done-flag”的标签,您可以在其中放置 _SUCCESS 文件以触发工作流或针对您的情况执行 map reduce 作业。还有调度作业的参数

    ${coord:current(1 + (coord:tzOffset() / 60))} ....

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-04-13
      • 1970-01-01
      • 1970-01-01
      • 2015-04-28
      • 1970-01-01
      • 2018-05-23
      相关资源
      最近更新 更多