【发布时间】:2017-07-25 19:12:09
【问题描述】:
我有一个火花数据框 df,其中有一列“id”(字符串)和另一列“值”(字符串数组)。我想创建另一个名为 count 的列,其中包含每个 id 的值的计数。
df 看起来像 -
id values
1fdf67 [dhjy1,jh87w3,89yt5re]
df45l1 [hj098,hg45l0,sass65r4,dh6t21]
结果应该看起来像 -
id values count
1fdf67 [dhjy1,jh87w3,89yt5re] 3
df45l1 [hj098,hg45l0,sass65r4,dh6t21] 4
我正在尝试执行以下操作-
df= df.select(id,values).toDF(id,values,values.count())
这似乎不符合我的要求。
【问题讨论】:
-
values不是变量,是吗?那么,values.count()会给你什么? -
我认为您正在寻找
withColumn()函数。
标签: python apache-spark dataframe pyspark