【发布时间】:2018-03-09 13:08:34
【问题描述】:
我正在使用 apache-spark 我的 Spark 作业每天创建 10k 个小文件(~50MB)对于 HDFS 中的命名节点来说太过分了
我尝试使用合并来减少输出文件的数量,但会减慢工作速度。 谁能建议我应该使用什么?
【问题讨论】:
-
日志是否显示了为什么使用 coalesce() 运行速度较慢?它只是减慢了保存到磁盘的速度,还是降低了上游任务的并行度?也许您需要使用 coalesce() 参数,而不是大幅减少数量...
标签: hadoop apache-spark hdfs partitioning