我们可以通过多种方式做到这一点,我建议使用shift 和groupby 查找最大记录,然后使用.loc 适当地过滤您的查询集。
设置。
from io import StringIO
import pandas as pd
d = """period, Customer, quantity , product
2020-01, Cust1, 12, TS
2020-02, Cust1, 12, TS
2020-03, Cust1, 14, SLM
2020-01, Cust2, 12, SLM
2020-02, Cust2, 12, TS
2020-03, Cust2, 14, SLM"""
df = pd.read_csv(StringIO(d),sep=',',parse_dates=['period'])
# as you have spaces in your csv above.
#df.columns = df.columns.str.strip()
#create a record end date.
df['period_end_date'] = df.groupby('Customer')['period'].shift(-1)
#find the previous product.
df.loc[df['period_end_date'].isna(),
'previous_product'] = df.groupby('Customer')['product'].shift(1)
此处的当前记录将是preiod_end_date 为空的位置。
print(df)
period Customer quantity product period_end_date previous_product
0 2020-01-01 Cust1 12 TS 2020-02-01 NaN
1 2020-02-01 Cust1 12 TS 2020-03-01 NaN
2 2020-03-01 Cust1 14 SLM NaT TS
3 2020-01-01 Cust2 12 SLM 2020-02-01 NaN
4 2020-02-01 Cust2 12 TS 2020-03-01 NaN
5 2020-03-01 Cust2 14 SLM NaT TS
如果您需要按照上面概述的预定义格式。
df.loc[df['period_end_date'].isna(),
'previous_product'] = ("FROM "
+ df.groupby('Customer')['product'].shift(1)
+ " TO "
+ df['product'] )
period Customer quantity product period_end_date previous_product
0 2020-01-01 Cust1 12 TS 2020-02-01 NaN
1 2020-02-01 Cust1 12 TS 2020-03-01 NaN
2 2020-03-01 Cust1 14 SLM NaT FROM TS TO SLM
3 2020-01-01 Cust2 12 SLM 2020-02-01 NaN
4 2020-02-01 Cust2 12 TS 2020-03-01 NaN
5 2020-03-01 Cust2 14 SLM NaT FROM TS TO SLM