【问题标题】:spark RDD saveAsTextFile does not use the specified filenamespark RDD saveAsTextFile 不使用指定的文件名
【发布时间】:2016-08-06 19:24:26
【问题描述】:

我有一些这样的代码

  wordCounts
  .map{ case (word, count) =>
    Seq(
      word,
      count
    ).mkString("\t")
  }
  .coalesce(1,true)
  .saveAsTextFile("s3n://mybucket/data/myfilename.csv")

但是 myfilename.csv 是作为我的 S3 存储桶中的目录创建的,并且文件名始终类似于 myfilename.csv/part-00000?有没有办法可以更改我正在写入的文件的名称?谢谢!

【问题讨论】:

标签: amazon-s3 apache-spark rdd


【解决方案1】:

我强烈建议您使用 Databrick 的 spark-csv 包在 Spark 中读取和写入 csv 文件。使用此包的(许多)好处之一是它允许您指定输出 csv 文件的名称 :)

【讨论】:

  • 谢谢格伦尼。这绝对是我要检查的内容(我现在将其标记为已接受)。
猜你喜欢
  • 2019-01-21
  • 2016-02-13
  • 2020-03-14
  • 2015-11-10
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多