【发布时间】:2018-06-26 21:23:25
【问题描述】:
我正在从一个文件夹中读取一组 avro 文件,并且程序错误并带有错误消息。 //格式化不正确。
df =sqlContext.read.format("com.databricks.spark.avro").load("/data/hadoop20180516/22/abc*.avro").count()
[Stage 2:==================================================>(27818 + 4) / 28318]18/06/14 10:53:44 ERROR Executor: Exception in task 27900.0 in stage 2.0 (TID 27905)
java.io.IOException: 不是 Avro 数据文件
文件夹有 30K+ 个文件,其中一个文件可能已损坏。 我想忽略坏文件并继续加载文件的其余部分。s
我尝试使用 .option 命令
.option("badRecordsPath", "/tmp/badRecordsPath") 没有用。
有什么建议吗?
【问题讨论】:
标签: pyspark