【发布时间】:2020-03-14 12:14:24
【问题描述】:
当 RDD 无法装入内存时,我们如何指定 Spark 溢出 RDD 的本地(unix)文件系统?我们在文档中找不到这个。分析确认它被保存在 Unix 文件系统中,而不是 HDFS 中。
我们使用 Elastic Map Reduce 在 Amazon 上运行。 Spark 溢出到/mnt。在我们的系统上,/mnt 是 EBS 卷,而 /mnt1 是 SSD。我们想泄露给/mnt。如果填满了,我们想溢出到/mnt2。我们希望/mnt 成为最后的手段。目前还不清楚如何配置这种方式,以及如何监控溢出。
我们已经审查了现有的 SO 问题:
- Understanding Spark shuffle spill 似乎已过期。
- Why SPARK cached RDD spill to disk? 和 Use SSD for SPARK RDD 讨论溢出行为,但不讨论文件溢出的位置。
- Spark shuffle spill metrics 是一个未回答的问题,显示了 Spill UI,但未提供我们要求的详细信息。
【问题讨论】:
标签: apache-spark