【问题标题】:Azure Data factory pipeline varied execution timesAzure 数据工厂管道不同的执行时间
【发布时间】:2018-09-28 23:58:44
【问题描述】:

我们有大约 190 个每小时使用文件需要在 24 小时内到达数据湖,然后我们才能启动以分析活动开始的管道。我们已经在调度程序上运行了这个管道,估计时间是我们预计所有文件都已经到达但并不总是发生,因此我们需要重新运行丢失文件的切片。

有没有更有效的方法来处理这个问题,而不是按计划安排管道,并由所有文件都到达数据湖的事件触发它。

TIA 输入!

【问题讨论】:

    标签: azure azure-data-lake azure-data-factory-2


    【解决方案1】:

    您可以在创建(或删除)新 blob 时添加事件触发器。我们在生产中使用逻辑应用程序执行此操作,但数据工厂 V2 现在似乎也支持它。好处是您不必估计正确的频率,您可以在需要时执行。

    注意:您可以执行的并发管道的数量是有限的,因此如果您一次将所有 190 个文件放入 Blob 存储中,您可能会遇到资源可用性问题。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-04-24
      • 2018-10-02
      • 2019-10-24
      • 2020-08-15
      • 1970-01-01
      • 2019-02-12
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多