【发布时间】:2015-10-29 21:15:55
【问题描述】:
想象一下,我有一个包含 100 条记录的 RDD,我用 10 条对其进行分区,所以每个分区现在有 10 条记录我只是将 rdd 转换为键值对 rdd 并将其保存到文件中,现在我的输出数据分为10 个分区对我来说没问题,但是在将输出数据保存到文件之前使用合并功能是最佳做法吗?例如 rdd.coalesce(1) 这只给出一个文件作为输出它不会在节点内打乱数据吗?想知道应该在哪里使用合并。
谢谢
【问题讨论】:
标签: scala apache-spark