【问题标题】:Specify which file system spark uses for spilling RDDs指定 spark 用于溢出 RDD 的文件系统
【发布时间】:2020-03-14 12:14:24
【问题描述】:

当 RDD 无法装入内存时,我们如何指定 Spark 溢出 RDD 的本地(unix)文件系统?我们在文档中找不到这个。分析确认它被保存在 Unix 文件系统中,而不是 HDFS 中。

我们使用 Elastic Map Reduce 在 Amazon 上运行。 Spark 溢出到/mnt。在我们的系统上,/mnt 是 EBS 卷,而 /mnt1 是 SSD。我们想泄露给/mnt。如果填满了,我们想溢出到/mnt2。我们希望/mnt 成为最后的手段。目前还不清楚如何配置这种方式,以及如何监控溢出。

我们已经审查了现有的 SO 问题:

【问题讨论】:

    标签: apache-spark


    【解决方案1】:

    结帐https://spark.apache.org/docs/2.2.1/configuration.html#application-properties并搜索

    spark.local.dir
    

    默认为 /tmp,尝试将其设置为您的 EBS 的位置

    注意:在 Spark 1.0 及更高版本中,这将被集群管理器设置的 SPARK_LOCAL_DIRS(独立、Mesos)或 LOCAL_DIRS (YARN) 环境变量覆盖。

    另请查看following stack overflow post 以获得更多有见地的信息

    【讨论】:

      猜你喜欢
      • 2016-08-06
      • 2019-05-07
      • 2015-09-23
      • 2017-03-06
      • 2020-06-05
      • 2019-01-15
      • 2018-11-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多