【发布时间】:2017-01-16 09:14:19
【问题描述】:
我有一个包含如下数据的数据集:
|c1| c2|
---------
| 1 | a |
| 1 | b |
| 1 | c |
| 2 | a |
| 2 | b |
...
现在,我想得到如下分组的数据 (col1: String Key, col2: List):
| c1| c2 |
-----------
| 1 |a,b,c|
| 2 | a, b|
...
我认为使用 goupByKey 将是一个足够的解决方案,但我找不到任何示例,如何使用它。
谁能帮我找到解决方案,使用 groupByKey 或使用任何其他转换和操作的组合通过使用数据集而不是 RDD 来获得此输出?
【问题讨论】:
标签: java apache-spark group-by dataset apache-spark-2.0