【问题标题】:Best Practice/Better Performance - Azure Data Factory and SQL Views最佳实践/更好的性能 - Azure 数据工厂和 SQL 视图
【发布时间】:2021-11-06 15:09:33
【问题描述】:

我有大约 10 个表用于创建 SQL 视图。其中一些是纯查找表。还有一些 SELECT 子句列使用连接和其他基本功能。 数据量预计约为 200 万行。 我需要使用 SQL 视图中的数据通过 Azure 数据工厂数据流加载到最终表中。

现在我只是想知道是否应该从视图中删除查找部分并将其添加到 ADF 流中。而且对于视图中 SELECTed 列中的连接和简单函数,我想我可能应该在数据流中使用 Derived Column 转换。

只是想了解最佳做法是什么。还有,就性能而言,哪一个会更好?

在视图中执行所需的转换和查找是否更好?这样,源数据将以所需的格式提供,并且流会更快,因为不会处理太多的转换。

但如果我必须在 SQL 视图本身中进行所有查找和转换,那么使用 ADF 等 ETL 工具有什么好处?

【问题讨论】:

    标签: azure-data-factory-2 sql-view


    【解决方案1】:

    我建议您将其全部保存在 SQL 中并使用标准 ADF 数据副本。如果您可以登录 SQL Server 并运行视图,而不是在 ETL 工具中挖掘转换,则更容易排除故障。

    复制活动不支持任何转换,但 ADF 数据流支持。

    但是,ADF 数据流必须启动一个 databricks 实例才能执行任何操作,这可能需要长达 5 分钟

    使用像 ADF 这样的 ETL 工具有什么好处

    当您使用 SQL 编写转换时,您最终会得到大量代码,这些代码有时可能难以维护和审核

    当您在 ETL 工具中编写转换时,您通常会获得有用的管道,例如日志记录、沿袭和调试。此外,ETL 工具可以更轻松地跨越多个数据源,即它可以将文本文件与数据库表结合起来。

    有些人还喜欢 ETL 工具的视觉方面。

    许多 ETL 工具还附带开箱即用的模板/向导,可帮助完成日常任务。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-12-22
      相关资源
      最近更新 更多