【发布时间】:2018-08-30 09:24:59
【问题描述】:
我有一个 DataFrame DF,我想计算 2 个类别(Cat1 和 Cat2)下每个 txn 的数量。
DF
+------------+-------+
| Category | txn |
+-----===----+-------+
| Cat1 | A |
| Cat2 | A |
| Cat1 | B |
| Cat1 | C |
| Cat2 | D |
| Cat1 | D |
| Cat2 | C |
| Cat1 | D |
| Cat1 | A |
| Cat2 | C |
| Cat1 | D |
| Cat1 | A |
| Cat2 | B |
| Cat1 | C |
| Cat2 | D |
+------------+-------+
代码:
DF.groupBy("category_name").agg(count("txn").as("txn_count")).show(false)
但这只是给我每个类别的总数。
期望的输出:(格式无所谓,只需要计数)
+------------+---------------------+
| Category | txn_count |
+-----===----+---------------------+
| Cat1 | A(3),B(1),C(2),D(3) |
| Cat2 | A(1),B(1),C(2),D(2) |
+------------+---------------------+
提前谢谢你。
【问题讨论】:
标签: scala apache-spark dataframe