【发布时间】:2015-12-22 23:36:01
【问题描述】:
我正在尝试使用 spark 处理一堆大型 json 日志文件,但每次使用 scala.MatchError 都会失败,无论我是否给它架构。
我只想跳过与架构不匹配的行,但我在 spark 的文档中找不到方法。
我知道编写一个 json 解析器并将其映射到 json 文件 RDD 可以完成工作,但我想使用sqlContext.read.schema(schema).json(fileNames).selectExpr(...),因为它更易于维护。
【问题讨论】:
-
如果验证数据不是选项,我怀疑是否有一种简单的方法。看起来您可以修补
JacksonParser.parseJson以记录而不是抛出异常。
标签: apache-spark apache-spark-sql