【问题标题】:Orchestration of Apache Spark using Apache Oozie使用 Apache Oozie 编排 Apache Spark
【发布时间】:2014-09-04 12:38:58
【问题描述】:

我们正在考虑将 apache spark 集成到我们的计算过程中,最初我们想使用 apache oozie 和标准 MR 或 MO(仅限地图)作业。

经过一些研究,仍有几个问题

  1. 是否可以使用 apache oozie 来编排 apache spark 进程?如果是,怎么做?
  2. oozie 是否不再需要或者可以自己触发处理编排? (统一似乎是 spark 的主要关注点之一

回答时请考虑以下场景

  1. 每 4 小时执行一次工作流
  2. 只要可以访问特定数据就执行工作流
  3. 触发工作流程并使用参数对其进行配置

提前感谢您的回答。

【问题讨论】:

  • 对 Oozie 不太了解,但我会说 spark 尽可能简单,因为大部分流程处理都是在工作中完成的
  • 在执行此操作时,我们多次遇到 Spark 类路径问题。我们有未解决的问题试图让 Spark 在 HDFS 上查看 jar。相反,它返回“跳过远程 jar”错误,如本文所示:mail-archives.apache.org/mod_mbox/incubator-spark-user/… 如果我们找到解决方案,我将再次发布
  • 谢谢!不幸的是,它仍然没有包含在适当的测试中。

标签: hadoop bigdata apache-spark oozie


【解决方案1】:

Oozie 4.2 支持 Spark 作为操作类型,请参阅 docs。您提到的场景是常见的 Oozie 功能。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-06-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-03-01
    • 2017-03-03
    • 2017-06-23
    • 1970-01-01
    相关资源
    最近更新 更多