【发布时间】:2021-12-22 01:55:18
【问题描述】:
我有一个来自 ravenDB 的 json,它不是有效的 json,因为它有重复的列。 所以我的第一步是清理 json,如果有重复,则为每个文件制作单独的 json。 我能够为示例文件做到这一点,它运行成功, 然后我尝试了一个 12 MB 的文件,它也可以工作。 但是当我尝试一个 10GB 大小的完整数据库备份文件时,它给出了错误。
这个 10 GB 的文件生成 3 个单独的 json,因为它有 3 次 DOCS 列。 第一个文件是 9.6GB,其他 2 个文件很小,比如 120MB 和 10KB。 对于第一个文件,当我尝试在 Synapse DWH 中加载它时,我得到以下错误。
由于原因导致作业失败:集群在执行期间遇到内存不足的问题。另外,请注意数据流有一个或多个自定义分区方案。使用自定义分区方案的转换:Json、Select1、FlattenDocsCS、Flatten2、Filter1、ChangeDataTypesDateColumns、CstomsShipment。 1. 请使用具有更大核心数和/或内存优化计算类型的集成运行时重试。 2. 请使用不同的分区方案和/或分区数重试。
我尝试发布管道,以便我不在调试模式和小型集群中运行。 我将集群大小更改为 32 个核心,并将优化选项卡中的分区方案更改为所有可能的事情。 但我仍然遇到错误。 请帮忙
【问题讨论】:
-
另外,当我将集成运行时的核心增加到 64 时,它给出以下错误。内部服务器错误:无法在作业集群上提交作业。集成运行时 'IR-Synapse-test',ActivityId: '410b7569-ff98-42cf-b8ca-a2e3ed30bae5
标签: azure out-of-memory azure-data-factory azure-data-factory-2 azure-synapse