【问题标题】:Spark read csv file submitted from --filesSpark读取从--files提交的csv文件
【发布时间】:2019-01-08 04:38:03
【问题描述】:

我正在向 yarn 上的远程 spark 集群提交 Spark 作业,并在 spark-submit --file 中包含一个文件我想将提交的文件作为数据帧读取。但是我对如何在不必将文件放入 HDFS 的情况下进行此操作感到困惑:

spark-submit \
--class com.Employee \
--master yarn \
--files /User/employee.csv \
--jars SomeJar.jar

spark: SparkSession = // create the Spark Session
val df = spark.read.csv("/User/employee.csv")

【问题讨论】:

标签: apache-spark


【解决方案1】:
spark.sparkContext.addFile("file:///your local file path ")

使用addFile 添加文件,以便它可以在您的工作节点上使用。由于您想以集群模式读取本地文件。

您可能需要根据 scala 和您使用的 spark 版本进行轻微更改。

【讨论】:

    【解决方案2】:

    employee.csv在executor的工作目录下,读取如下:

    val df = spark.read.csv("employee.csv")
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2015-12-04
      • 2021-10-11
      • 2019-02-08
      • 2021-12-15
      • 1970-01-01
      • 2018-09-12
      • 2022-01-13
      • 2017-03-09
      相关资源
      最近更新 更多