【发布时间】:2019-09-25 00:53:28
【问题描述】:
我正在使用 Spark 结构化流。另外,我正在使用Scala。我想将配置文件传递给我的 spark 应用程序。此配置文件托管在HDFS。例如;
spark_job.conf (HOCON)
spark {
appName: "",
master: "",
shuffle.size: 4
etc..
}
kafkaSource {
servers: "",
topic: "",
etc..
}
redisSink {
host: "",
port: 999,
timeout: 2000,
checkpointLocation: "hdfs location",
etc..
}
如何将其传递给 Spark 应用程序?如何在 Spark 中读取此文件(hosted HDFS)?
【问题讨论】:
-
我见过这个解决方案。但我正在寻找其他方式。因为这种方式对我来说并不好。另外,我正在使用 Scala。
-
还有一个等效的 Scala API。如果出于某种原因你不想那样做,你应该解释为什么不这样做。
-
因为这个方案使用了hadoop配置文件。我的代码没有“hadoop conf”文件。另外,我想将任何“spark conf”传递给 appName 等应用程序。因此我不能使用 spark.sparkContext.hadoopConfiguration。我不知道我该怎么做。
-
如果您不想将数据读入 Hadoop 配置对象,github.com/lightbend/config 是一种流行的通用 HOCON 配置读取器。您仍然需要使用 Scala HDFS API 读取文件。
标签: apache-spark hadoop configuration apache-spark-sql spark-structured-streaming