【发布时间】:2014-09-04 12:38:58
【问题描述】:
我们正在考虑将 apache spark 集成到我们的计算过程中,最初我们想使用 apache oozie 和标准 MR 或 MO(仅限地图)作业。
经过一些研究,仍有几个问题:
- 是否可以使用 apache oozie 来编排 apache spark 进程?如果是,怎么做?
- oozie 是否不再需要或者可以自己触发处理编排? (统一似乎是 spark 的主要关注点之一)
回答时请考虑以下场景:
- 每 4 小时执行一次工作流
- 只要可以访问特定数据就执行工作流
- 触发工作流程并使用参数对其进行配置
提前感谢您的回答。
【问题讨论】:
-
对 Oozie 不太了解,但我会说 spark 尽可能简单,因为大部分流程处理都是在工作中完成的
-
在执行此操作时,我们多次遇到 Spark 类路径问题。我们有未解决的问题试图让 Spark 在 HDFS 上查看 jar。相反,它返回“跳过远程 jar”错误,如本文所示:mail-archives.apache.org/mod_mbox/incubator-spark-user/… 如果我们找到解决方案,我将再次发布
-
谢谢!不幸的是,它仍然没有包含在适当的测试中。
标签: hadoop bigdata apache-spark oozie