【发布时间】:2016-06-30 21:42:52
【问题描述】:
我有一个 Spark 应用程序,内存不断不足,集群有两个节点,内存大约 30G,输入数据大小约为几百 GB。
该应用程序是一个 Spark SQL 作业,它从 HDFS 读取数据并创建一个表并缓存它,然后执行一些 Spark SQL 查询并将结果写回 HDFS。
最初我将数据分成 64 个分区并得到 OOM,然后我能够通过使用 1024 个分区来解决内存问题。但是为什么使用更多的分区可以帮助我解决 OOM 问题呢?
【问题讨论】:
标签: apache-spark