【发布时间】:2020-03-27 01:58:17
【问题描述】:
我有两个 Pyspark df
df1
TransID Date custusername
1 11/01 1A
2 11/01 1A
3 11/02 1A
4 11/02 1A
5 11/03 1A
df2
custusername Date CustID
1A 11/01 xx1
1A 11/02 xx1
1A 11/03 xx2
加入两个数据帧并计数后的期望输出
Date CustID Count
11/01 xx1 2
11/02 xx1 2
11/03 xx2 1
我得到的实际输出是
11/01 xx1 2
11/01 xx2 2
11/02 xx1 2
11/02 xx2 2
11/03 xx1 1
11/03 xx2 1
因为 CustID 在 11/03 更新,我的计数重复了。
我的代码
join = [df1.custusername == df2.custusername]
joined = df1.join(df2, join, "inner")
【问题讨论】:
标签: python dataframe join pyspark