【发布时间】:2018-01-13 21:22:21
【问题描述】:
我的DataFrame结构如下:
-------------------------
| Brand | type | amount|
-------------------------
| B | a | 10 |
| B | b | 20 |
| C | c | 30 |
-------------------------
我想通过将 type 和 amount 分组到 type 的一列中来减少行数:Map
所以Brand 将是唯一的,MAP_type_AMOUNT 将有key,value 对应每个type amount 组合。
我认为 Spark.sql 可能有一些函数可以在这个过程中提供帮助,还是我必须将 RDD 作为 DataFrame 并“自己”转换为地图类型?
预期:
-------------------------
| Brand | MAP_type_AMOUNT
-------------------------
| B | {a: 10, b:20} |
| C | {c: 30} |
-------------------------
【问题讨论】:
-
我认为我们在数据框中没有类似 rdd 的 collectAsmap 的东西。更好的是你可以使用自己的转换函数。
标签: python sql dictionary pyspark spark-dataframe