【发布时间】:2018-12-18 10:17:47
【问题描述】:
我想为 groupby 中的每个组分配一个唯一的 id 编号,从 0 或 1 开始,并使用 pyspark 为每个组递增 1。
我之前使用带有 python 的 pandas 和命令:
df['id_num'] = (df
.groupby('column_name')
.grouper
.group_info[0])
输入和期望输出的玩具示例是:
输入
+------+
|object|
+------+
|apple |
|orange|
|pear |
|berry |
|apple |
|pear |
|berry |
+------+
输出:
+------+--+
|object|id|
+------+--+
|apple |1 |
|orange|2 |
|pear |3 |
|berry |4 |
|apple |1 |
|pear |3 |
|berry |4 |
+------+--+
【问题讨论】:
标签: python pandas apache-spark pyspark