【发布时间】:2018-09-05 09:40:23
【问题描述】:
虽然groupBy apache spark 中的数据框,后来使用聚合与数据框中的另一列。有没有性能问题? reduceBy 可以成为更好的选择吗?
df.groupBy("primaryKey").agg(max("another column"))
【问题讨论】:
-
不,这个问题显然不是“DataFrame / Dataset groupBy behavior/optimization”的重复,值得重新打开。
-
不是重复的。
标签: apache-spark group-by spark-dataframe