【问题标题】:Bypass first line of each file in Spark (Scala)绕过 Spark (Scala) 中每个文件的第一行
【发布时间】:2015-11-06 16:10:46
【问题描述】:

我正在处理一个 S3 文件夹,其中包含 Spark 中的 csv.gz 文件。每个 csv.gz 文件都有一个包含列名的标题。

我将包含的数据加载到Spark的方式是引用路径/文件夹,像这样:

val rdd = sc.textFile("s3://.../my-s3-path")

如何跳过每个文件中的标题,以便只处理值?

谢谢

【问题讨论】:

    标签: scala amazon-s3 apache-spark


    【解决方案1】:

    你可以这样做:

    val rdd = sc.textFile("s3://.../my-s3-path").mapPartitions(_.drop(1))
    

    由于每个输入文件都经过 gzip 压缩,因此将在单独的分区下加载。如果我们映射所有分区并删除第一行,我们将因此从每个文件中删除第一行。

    【讨论】:

      猜你喜欢
      • 2019-07-12
      • 2020-06-25
      • 2020-12-15
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-05-28
      相关资源
      最近更新 更多