【问题标题】:Fetching all the csv filenames from HDFS directory using spark/scala使用 spark/scala 从 HDFS 目录中获取所有 csv 文件名
【发布时间】:2020-04-21 11:12:03
【问题描述】:

有人可以指导我如何使用 scala 从我的 HDFS 目录中只获取 .csv 文件。 我正在尝试从我的 hdfs 位置获取所有 csv 文件名并编写以下代码。

    var Fsys1 = FileSystem.get(sparksession.sparkContext.hadoopConfiguration)
    var FileNames = Fsys1 .listStatus(new  Path("hdfspath").filter(_.isFile).map(_.getPath.getName).toList

它给了我所有的文件名,但我只想获取 .csv 文件。

【问题讨论】:

  • .filter(_.toLowerCase.endsWith(".csv"))

标签: scala apache-spark


【解决方案1】:

正如@pasha701 在 cmets 中提到的那样。您可以过滤以“.csv”结尾的文件

.filter(_.toLowerCase.endsWith(".csv"))

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-06-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-02-03
    • 2015-12-04
    相关资源
    最近更新 更多