【发布时间】:2021-07-29 13:50:54
【问题描述】:
我有以下 pyspark 数据框。
| cust_id | apply_date |
|---|---|
| 1 | 01-06-2014 |
| 1 | 01-07-2014 |
| 1 | 01-04-2018 |
| 1 | 01-07-2018 |
| 2 | 01-04-2015 |
| 2 | 01-05-2015 |
| 2 | 01-06-2015 |
| 2 | 01-09-2015 |
我想计算客户在过去 6 个月内提出的申请数量 不包括当前的应用程序。
所以输出应该是:
| cust_id | apply_date | apps_prev_180_days |
|---|---|---|
| 1 | 01-06-2014 | 0 |
| 1 | 01-07-2014 | 1 |
| 1 | 01-04-2018 | 0 |
| 1 | 01-07-2018 | 1 |
| 2 | 01-04-2015 | 0 |
| 2 | 01-05-2015 | 1 |
| 2 | 01-06-2015 | 2 |
| 2 | 01-09-2015 | 3 |
我尝试在窗口函数中创建滞后变量并计算应用程序,但是这只考虑了以前的应用程序而不是所有应用程序。 任何指针如何做到这一点?
【问题讨论】:
-
请编辑问题以包含您的代码 - 最好是 minimal reproducible example - 以及它的输出。
标签: python dataframe apache-spark pyspark