【发布时间】:2020-06-24 19:47:39
【问题描述】:
我目前开发的管道利用 Azure 数据工厂进行编排,利用 Azure DataBricks 进行计算以执行以下操作...我在 Azure Blob 中实时接收数以万计的单记录 json 文件在 15 分钟的基础上,我检查文件夹中是否有任何新文件,一旦发现,我使用 Databricks 将它们加载到数据框中,并将它们加载到 SQL DB 中的单个文件中,然后让其他 ADF 作业触发存储过程,然后将我的数据转换为最终的 SQL 表.... 我们正在寻求远离 Databricks,因为我们不是因为它的真正功能而使用它,但当然要支付 Databricks 成本。寻找其他解决方案的想法,以定期(即 15 分钟)将数以万计的 json 加载到 SQL DB 中(最少或没有转换)。我们是一家微软商店,因此不一定要放弃 Azure 工具。
【问题讨论】:
标签: azure etl pipeline databricks