【发布时间】:2015-11-06 16:10:46
【问题描述】:
我正在处理一个 S3 文件夹,其中包含 Spark 中的 csv.gz 文件。每个 csv.gz 文件都有一个包含列名的标题。
我将包含的数据加载到Spark的方式是引用路径/文件夹,像这样:
val rdd = sc.textFile("s3://.../my-s3-path")
如何跳过每个文件中的标题,以便只处理值?
谢谢
【问题讨论】:
标签: scala amazon-s3 apache-spark
我正在处理一个 S3 文件夹,其中包含 Spark 中的 csv.gz 文件。每个 csv.gz 文件都有一个包含列名的标题。
我将包含的数据加载到Spark的方式是引用路径/文件夹,像这样:
val rdd = sc.textFile("s3://.../my-s3-path")
如何跳过每个文件中的标题,以便只处理值?
谢谢
【问题讨论】:
标签: scala amazon-s3 apache-spark
你可以这样做:
val rdd = sc.textFile("s3://.../my-s3-path").mapPartitions(_.drop(1))
由于每个输入文件都经过 gzip 压缩,因此将在单独的分区下加载。如果我们映射所有分区并删除第一行,我们将因此从每个文件中删除第一行。
【讨论】: