【发布时间】:2020-09-16 02:18:25
【问题描述】:
大约 10 年来,我们所有的 ETL 工作负载都是在 IBM Datastage 和 Oracle 作为数据库上设计的,但现在,企业正在寻找提供 的开源平台选项分布式并行计算可以在更短的时间内完成相同的任务并节省一些技术成本。 一直以来我都不是 Java 人,但是我有 Python 知识,并且我还接受了 Apache Spark 的正式培训,我想利用这些知识将我们现有的 Datastage 设计转换为 Spark。 以下是我们目前在所有 Datastage 作业中执行的一些常见操作
- 从平面文件(txt/csv)中读取数据
- 对其他小型数据表执行查找(正常/范围/稀疏)
- 与其他 LARGE 表执行联接
- 将数据写入表中
- 调用 Siebel Enterprise Integration Manager 将数据从一个表加载到 Siebel 表中
- 从多个表中提取数据并创建一个单一的平面文件(txt/csv)
- ftp 文件到目标服务器
所有这些操作都可以在 Spark 中完成吗? 至少我正在寻求在 Spark 中重新创建步骤 #1、#2、#3、#4 和 #6,这(在我的 Spark 知识范围内)是可以实现的。
请帮助/将我重定向到在这方面有帮助的资源。
【问题讨论】:
-
写得很好,但很抱歉,建议请求是题外话。 StackOverflow 致力于帮助解决编程代码问题。请先阅读Help On-topic 和Help How-to-ask,然后再在此处发布更多问题。祝你好运。
标签: oracle apache-spark datastage