【发布时间】:2022-01-12 13:49:45
【问题描述】:
下面给出的是一个 pyspark 数据框,我需要将行值与 groupby 相加
load_dt|org_cntry|sum(srv_curr_vo_qty_accs_mthd)|sum(srv_curr_bb_qty_accs_mthd)|sum(srv_curr_tv_qty_accs_mthd)|
+-------------------+---------+------------------------------+------------------------------+------------------------------+
|2021-12-06 00:00:00| null| NaN| NaN| NaN|
|2021-12-06 00:00:00| PANAMA| 360126.0| 214229.0| 207950.0|
条件:
1.groupby(load_dt,org_cntry)
2.sum 行值(sum(srv_curr_vo_qty_accs_mthd)|sum(srv_curr_bb_qty_accs_mthd)|sum(srv_curr_tv_qty_accs_mthd)|
预期输出
load_dt org_cntry total_sum
2021-12-06 Panama 782305
【问题讨论】:
-
您能补充一下预期的输出吗?
-
是的,我添加了预期的输出。基本上它应该根据 groupby 条件添加行值
标签: apache-spark pyspark apache-spark-sql