【发布时间】:2022-10-25 12:47:39
【问题描述】:
我正在尝试将 Glue 自定义 PySpark 作业迁移到 SageMaker 处理,以从 SageMaker Pipeline 提供的 MLOps 中受益。
- 在 Glue 中,我的工作使用 10 个 G.1X(4 个 CPU,16G 内存)实例并在 10 分钟内完成。
- 我尝试使用类似的 SageMaker 处理实例(10 ml.m5.xlarge 实例,4 个 CPU,每个 16G 内存),但由于 OOM 失败“OutOfMemoryError:请使用具有更多内存的实例类型,或确保您的处理容器使用的内存不超过可用内存。”当我检查 cloudwatch 实例指标时,所有 10 个实例的最大内存使用率仅为 37.4%,因此实际上并没有用完所有内存。
Glue 不会在其仪表板上公开
spark-submit参数(例如 --conf spark.executor.memory),所以我如何检查我的 SageMaker 处理作业是否使用与 Glue 作业相同的配置,以及最佳实践是什么保持他们的火花配置是一样的?
【问题讨论】: