【发布时间】:2018-02-05 19:59:11
【问题描述】:
我正在使用 spark 的读取功能从 csv 文件中读取数据
val schema = ScalaReflection.schemaFor[CustomClass].dataType.asInstanceOf[StructType]
sparkSession.read.option("delimiter",",").schema(schema).csv("test.csv").as[Customclass]
问题是,当某行在末尾被剪切或者在开头缺少某些字段时,spark 在行的末尾设置空值。我确实想在读取时进行验证,以便一旦某一行没有预期的分隔符数量,spark 就会告诉我或抛出异常。
有没有办法做到这一点?我目前的方法是读取 rdd 中的每一行,并自己对每一行进行验证。之后,我将我的 rdd 转换为 Dataframe。所以我的问题是:有没有办法跳过这一步并在读取时进行验证?
【问题讨论】:
标签: csv validation apache-spark