【发布时间】:2022-08-17 00:51:50
【问题描述】:
我有一个由多个键分区的增量表,其中一个键包括日期,不包括分钟详细信息(仅最多小时,例如 - 2022 年 7 月 15 日 07 日星期五)
现在,随着数据通过批处理和流式摄取工作流程不断摄取,评估执行器数量以从增量表中读取所有数据的最佳策略是什么?
一种非常幼稚的方法可能是让 spark 自动缩放,但我们可能仍然需要使用随机分区等。寻找相同的提示或最佳实践。谢谢!
-
这非常特定于您的用例。尝试使用不同配置集并找出最适合您的要求的最佳方法,这也将帮助您为设置(数据大小、集群设置等)建立基准
标签: delta-lake