【问题标题】:Spark Dataframe from nested directories with labels来自带有标签的嵌套目录的 Spark Dataframe
【发布时间】:2021-10-05 21:50:39
【问题描述】:

我正在尝试以这样的嵌套目录结构从 HDFS 读取 8gb 图像:

   train_set
   |___dir_0
   |   |___0.jpg
   |   |___1.jpg
   |___dir_2
   |   |___0.jpg
   |   |___1.jpg

我正在使用 ScalaSpark,我已经尝试了所有 doc 解决方案,但我无法摆脱这种情况。我想要一个带有 col "image" 和 "label" 的 Dataframe,其中 label 是图像父目录的名称(或索引)。 非常感谢您的宝贵时间。

【问题讨论】:

  • 一般来说,您应该添加您在问题上尝试过的代码。

标签: image scala dataframe apache-spark hdfs


【解决方案1】:

当您将图像作为数据框读取时,您将获得一个称为图像的结构列。图像的子列之一是标记父目录的原点。

spark.read.format("image").load("train_set/dir_0/*.jpg", "train_set/dir_2/*.png")
  .selectExpr("image", "image.origin as label").show

如果您使用的是版本 >= 3.0.0 的 spark,那么您可以使用 some options 而不是将多个文件路径作为参数传递给 load() 方法。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-11-06
    • 1970-01-01
    • 2021-07-18
    • 1970-01-01
    • 2019-11-16
    • 2020-02-18
    • 1970-01-01
    相关资源
    最近更新 更多