【发布时间】:2023-03-24 15:52:01
【问题描述】:
大家,我试图在双分组数据帧中找到重复的行,但我不明白该怎么做。
df_part[df_part.income_flag==1].groupby(['app_id', 'month_num'])['amnt'].duplicate()
例如 df:
所以我想看到这样的东西:
所以,如果我使用这个代码,我会看到有两个相同的值 'amnt' 0.387677 但在不同的月份......这是我需要的信息
df_part[(df_part.income_flag==2) & df_part.duplicated(['app_id','amnt'], keep=False)].groupby(['app_id', 'amnt', 'month_num'])['month_num'].count().head(10)
app_id amnt month_num
0 0.348838 3 1
0.387677 6 1
10 2
0.426544 2 2
0.475654 2 1
0.488173 1 1
1 0.297589 1 1
4 1
0.348838 2 1
0.426544 8 3
Name: month_num, dtype: int64
谢谢大家。
【问题讨论】:
-
使用
df_part.groupby(['app_id', 'month_num']).count()。 -
你需要
df_part[(df_part.income_flag==2) & df_part.duplicated(['app_id','amnt','month_num'], keep=False)].groupby(['app_id', 'amnt', 'month_num'])['month_num'].count().head(10)吗? -
已将
month_num添加到duplicated -
@jezrael 如果我将month_num 添加到重复项中,则会在同一月份找到重复项,但我需要不同。所以我已经尝试再添加一个条件
df_part[(df_part.income_flag==2) & df_part.duplicated(['app_id','amnt'], keep=False) & ~df_part.duplicated(['month_num'], keep=False)].head(10)但它不起作用 -
@IvanTimishenko - 嗯,我有你的真实数据,所以无法测试。
标签: python pandas duplicates