【发布时间】:2021-09-10 23:44:08
【问题描述】:
使用 Spark rdd 可以通过 groupByKey 进行分组,然后在每个组中排序,然后映射到大型数据集。这样做的天真方式映射到每个组并为每个组创建一个列表并对其进行排序。但是,这种创建列表可能会导致具有许多条目的组出现内存不足的问题。有没有办法让 Spark 进行排序以避免内存不足的问题。
【问题讨论】:
-
您目前是否遇到内存错误?
-
对分组值进行排序的任何具体原因?如果需要识别 top-n 或 bottom-n 值,则可以通过 reduceByKey 逻辑来完成。
标签: apache-spark