【发布时间】:2017-04-05 15:01:02
【问题描述】:
我已经从https://censys.io/ 下载了一个xxxx.json.lz4 文件,但是当我尝试使用以下行读取文件时,我没有得到任何数据输出/计数为 0。
metadata_lz4 = spark.read.json("s3n://file.json.lz4")
虽然手动解压可以正常工作并且可以导入Spark,但它没有返回任何结果。
我也试过了
val metadata_lz4_2 = spark.sparkContext.newAPIHadoopFile("s3n://file.json.lz4", classOf[TextInputFormat], classOf[LongWritable], classOf[Text])
这也不会返回任何结果。
我有多个 100GBs 文件,所以我非常希望不必手动解压缩每个文件。
有什么想法吗?
【问题讨论】:
-
although decompressing manually works fine你能告诉我如何手动执行此操作吗?
标签: json scala apache-spark spark-dataframe