【发布时间】:2017-02-21 11:45:41
【问题描述】:
我在 Azure Data Lake 存储 (257 gb) 中有一个非常大的文件,当我昨天尝试对其进行简单提取时,我收到以下错误
Vertex 在运行超过 5 小时后终止。带 guid 的顶点 SV1_Extract_Partition[0][53].v0 的输入大小 {2F8802B8-F93A-47EE-80E2-274590BD76A5} 为 1.171594 GB。多数情况 情况下,这是由数据倾斜引起的,例如一个数据分区 包含大部分数据。使用不同的分区方案或 重新分区数据可以解决此类问题。
所以我很确定发生了什么是 U-SQL 没有正确分区我的文件。我正在使用自定义的书面提取器,但我不明白为什么会这样和问题。
如何确保对文件进行分区。这个错误让我损失了很多钱(超过 2000 美元),所以我真的不想再次运行这种规模的任何东西,然后才能确保在作业运行时我的文件被正确分区。
我真的必须手动将我的文件拆分成更小的文件吗?
【问题讨论】:
-
我能否建议处理一个 2.57GB(甚至 MB)的示例文件,让您的过程变得更好、更高效,这样它可以在不到一分钟的时间内完成,然后扩展到 20GB 以确保您的流程呈线性扩展,依此类推...
标签: azure-data-lake u-sql