【发布时间】:2016-08-04 12:22:42
【问题描述】:
我正在尝试 GZIP 并将 RDD 发送到 S3,如下所示:
dwPartitioned.saveAsTextFile(s"s3n://$accessKey:$secretKey@bucket", classOf[GzipCodec])
作业开始运行,不久后出现:
org.apache.spark.SparkException: Job aborted due to stage failure: ... : java.io.IOException: No space left on device
我读到由于编码的原因,需要进行一些改组,这需要生成临时文件。真的吗?我是否滥用了该功能?这里有什么可以优化的吗?
更重要的是 - 我如何在内存中实现这一点?
如果您需要更多信息,我很乐意追加。
【问题讨论】:
标签: scala apache-spark amazon-s3 gzip