【问题标题】:Process more than 5000 rows from lookup activity in Azure Data factory在 Azure 数据工厂中处理超过 5000 行的查找活动
【发布时间】:2021-03-15 04:59:55
【问题描述】:

我需要在数据工厂的另一个活动中 Paas Id。Id 以 json 格式存储在 blob 存储中。 我在我的活动中使用查找来获取数据。但是当数据超过 5000 时,我的管道会失败。我需要一个解决方案。我不了解堆栈溢出中的现有解决方案。

【问题讨论】:

  • 你看过哪个解决方案是堆栈溢出 - 你能添加链接吗?
  • 是的,当然..我已经尝试过了,但由于我有动态的行数,所以无法成功。由于我是 ADF 的新手,所以活动图的实现会对我有更多帮助。请在下面的链接中找到。 docs.microsoft.com/en-us/answers/questions/42083/…
  • 好的,该解决方案看起来是正确的方法 - 以前使用过。但是,您是否首先查询 SQL 表以将 id 放入 blob?
  • 是的..我有 cosmos db 容器,我只从中获取我想要的项目并存储在 blob 容器中。然后我使用查找来获取 ID 并 paas 每个我在 foreach 循环活动中。
  • 如果可能的话,我会请求您上传活动图以查找您使用过的地方。

标签: azure-data-factory azure-data-factory-2 azure-data-factory-pipeline


【解决方案1】:

啊,好吧,你不能在 Cosmos 中合理地使用 OFFSET/LIMIT 分页,ADF 不能使用延续令牌。此外,您不能从 blob 中查找 >5000 个结果或对 blob 输出进行分页。

如果我有这个问题,我会根据这个想法尝试以下Azure Data Factory DYNAMICALLY partition a csv/txt file based on rowcount

  • 使用数据流从 cosmos 获取数据并使用分区写入 几个 json 文件,每个
  • ForLoop 遍历这些 blob
  • 拥有一个执行查找和调用 API 的嵌套管道,就像现在一样 - 现在查找最多只能包含 5000 个项目

【讨论】:

    猜你喜欢
    • 2021-12-17
    • 2022-11-11
    • 1970-01-01
    • 1970-01-01
    • 2021-12-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多