【发布时间】:2015-09-23 19:14:19
【问题描述】:
我有几个 Spark 作业,每天处理数千个文件。文件大小可能从 MB 到 GB。完成工作后,我通常使用以下代码保存
finalJavaRDD.saveAsParquetFile("/path/in/hdfs"); OR
dataFrame.write.format("orc").save("/path/in/hdfs") //storing as ORC file as of Spark 1.4
Spark 作业在最终输出目录中创建大量小部件文件。据我了解,Spark 会为每个分区/任务创建部分文件,如果我错了,请纠正我。我们如何控制 Spark 创建的部分文件的数量?
最后,我想使用这些 parquet/orc 目录创建 Hive 表,我听说当我们没有大量小文件时,Hive 很慢。
【问题讨论】:
标签: apache-spark hive apache-spark-sql parquet