【发布时间】:2017-04-28 09:28:56
【问题描述】:
我正在尝试使用 scala SparkStreaming 程序读取文件。该文件存储在我的本地计算机上的一个目录中,并尝试将其作为新文件写入我的本地计算机本身。但是,每当我编写流并将其存储为镶木地板时,我最终都会得到空白文件夹。
这是我的代码:
Logger.getLogger("org").setLevel(Level.ERROR)
val spark = SparkSession
.builder()
.master("local[*]")
.appName("StreamAFile")
.config("spark.sql.warehouse.dir", "file:///C:/temp")
.getOrCreate()
import spark.implicits._
val schemaforfile = new StructType().add("SrNo",IntegerType).add("Name",StringType).add("Age",IntegerType).add("Friends",IntegerType)
val file = spark.readStream.schema(schemaforfile).csv("C:\\SparkScala\\fakefriends.csv")
file.writeStream.format("parquet").start("C:\\Users\\roswal01\\Desktop\\streamed")
spark.stop()
我的代码中是否有任何遗漏或我出错的地方?
我也尝试从 hdfs 位置读取此文件,但相同的代码最终没有在我的 hdfs 上创建任何输出文件夹。
【问题讨论】:
标签: scala apache-spark spark-streaming parquet