【问题标题】:Translating ETL jobs from IBM Datastage to Apache Spark将 ETL 作业从 IBM Datastage 转换为 Apache Spark
【发布时间】:2020-09-16 02:18:25
【问题描述】:

大约 10 年来,我们所有的 ETL 工作负载都是在 IBM Datastage 和 Oracle 作为数据库上设计的,但现在,企业正在寻找提供 开源平台选项分布式并行计算可以在更短的时间内完成相同的任务并节省一些技术成本。 一直以来我都不是 Java 人,但是我有 Python 知识,并且我还接受了 Apache Spark 的正式培训,我想利用这些知识将我们现有的 Datastage 设计转换为 Spark。 以下是我们目前在所有 Datastage 作业中执行的一些常见操作

  1. 从平面文件(txt/csv)中读取数据
  2. 对其他小型数据表执行查找(正常/范围/稀疏)
  3. 与其他 LARGE 表执行联接
  4. 将数据写入表中
  5. 调用 Siebel Enterprise Integration Manager 将数据从一个表加载到 Siebel 表中
  6. 从多个表中提取数据并创建一个单一的平面文件(txt/csv)
  7. ftp 文件到目标服务器

所有这些操作都可以在 Spark 中完成吗? 至少我正在寻求在 Spark 中重新创建步骤 #1、#2、#3、#4 和 #6,这(在我的 Spark 知识范围内)是可以实现的。

请帮助/将我重定向到在这方面有帮助的资源。

【问题讨论】:

  • 写得很好,但很抱歉,建议请求是题外话。 StackOverflow 致力于帮助解决编程代码问题。请先阅读Help On-topicHelp How-to-ask,然后再在此处发布更多问题。祝你好运。

标签: oracle apache-spark datastage


【解决方案1】:

DataStage 可以在 Spark 上运行。与您的 IBM 客户代表交谈。 https://www.ibm.com/support/knowledgecenter/SSZJPZ_11.7.0/com.ibm.swg.im.iis.ds.fd.doc/topics/t_config_spark.html

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-02-08
    • 2019-11-09
    • 1970-01-01
    • 2016-05-09
    • 2021-03-26
    • 1970-01-01
    相关资源
    最近更新 更多