【发布时间】:2020-04-21 11:12:03
【问题描述】:
有人可以指导我如何使用 scala 从我的 HDFS 目录中只获取 .csv 文件。 我正在尝试从我的 hdfs 位置获取所有 csv 文件名并编写以下代码。
var Fsys1 = FileSystem.get(sparksession.sparkContext.hadoopConfiguration)
var FileNames = Fsys1 .listStatus(new Path("hdfspath").filter(_.isFile).map(_.getPath.getName).toList
它给了我所有的文件名,但我只想获取 .csv 文件。
【问题讨论】:
-
.filter(_.toLowerCase.endsWith(".csv"))
标签: scala apache-spark