【问题标题】:Azure Data PipelineAzure 数据管道
【发布时间】:2022-07-03 21:50:51
【问题描述】:

如何处理摄取或以何种方式处理 - 每天获取相同数量的数据(例如 10 GB)。一些不变,一些修改,一些新,​​但你必须只插入修改和新的,拒绝所有不变的。我们将在 ADF 中使用哪种工具/流程。

【问题讨论】:

  • 您需要在问题中添加更多详细信息才能得到回答

标签: azure-data-factory


【解决方案1】:

你需要做两件事

  1. 也许可以尝试 SCD(缓慢变化的维度),添加一个新列来区分新行和修改后的行与未更改的行,也许考虑添加一列(修改日期、标志等)。
  2. 创建一个查找活动,单击它,在源选项中,单击输入 -> 然后在查询栏中,粘贴您的命令(假设选择 insert_date 与修改日期不同的所有行) 请注意,查找活动仅限于 5000 行。 scd 链接

https://docs.microsoft.com/en-us/sql/integration-services/data-flow/transformations/slowly-changing-dimension-transformation?view=sql-server-ver16

【讨论】:

    【解决方案2】:

    这个过程取决于数据的类型和来源。

    • 如果源是 Azure blob,并且您想要复制新文件和修改后的文件,则可以使用复制活动。
      在复制活动的源中,转到按最后修改的过滤器并给出 @adddays(utcnow(),-1) 在开始时间和@utcnow() 在结束时间。

    为此添加一个触发器,您可以通过它每 24 小时复制一次新的/更新的文件。

    • 如果来源是SQL数据库,您可以尝试@Sally Dabbah建议的添加新列的方法。

    • 如果您使用 Azure SQL 数据库和托管实例,您可以在其中使用 CDC(更改数据捕获),它会捕获每一行的数据更改。 p>

      请参考这个Official Microsoft Documentation 一步一步 关于这个过程的解释。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-10-24
      • 1970-01-01
      • 1970-01-01
      • 2020-08-15
      • 2020-12-01
      • 1970-01-01
      • 1970-01-01
      • 2023-04-03
      相关资源
      最近更新 更多