【发布时间】:2020-02-26 15:05:20
【问题描述】:
我正在 Databricks 集群中执行 Spark 作业。我通过 Azure 数据工厂管道触发该作业,它以 15 分钟的间隔执行,因此在 successful execution of three or four times 之后它会失败并抛出异常 "java.lang.OutOfMemoryError: GC overhead limit exceeded"。
尽管上述问题有很多答案,但在大多数情况下,他们的工作没有运行,但在我的情况下,在成功执行之前的一些工作后它会失败。
我的数据大小仅小于 20 MB。
所以我的问题是我应该对服务器配置进行哪些更改。如果问题来自我的代码,那么为什么它大部分时间都成功了。请建议并建议我解决方案。
【问题讨论】:
-
投反对票的人应该说明原因。
-
赞成但不反对
标签: apache-spark databricks azure-databricks