【问题标题】:How can I delete duplicates group 3 columns using two criteria (first two columns)?如何使用两个条件(前两列)删除重复的组 3 列?
【发布时间】:2018-05-29 11:34:38
【问题描述】:

那是我的数据集enter code here

Year created  Week created  SUM_New  SUM_Closed  SUM_Open
0          2018             1       17           0        82
1          2018             6       62          47        18
2          2018             6       62          47        18
3          2018             6       62          47        18
4          2018             6       62          47        18

在最后三列中已经有年份和周的总和。我需要删除重复项,以便表包含唯一值(对于上面的示例):

Year created  Week created  SUM_New  SUM_Closed  SUM_Open
0          2018             1       17           0        82
4          2018             6       62          47        18

我尝试对数据进行分组,但它以某种方式出错,并且只为一列完成了我需要的操作。

df.groupby(['Year created', 'Week created']).size()

然后输出:

Year created  Week created
2017          48               2
              49              25
              50              54
              51              36
              52               1
2018          1               17
              2               50
              3               37

但这只是一列,我不知道是哪一列,因为即使我将数据分成三个部分并为每个部分执行相同的过程,我得到的结果都相同(如上)。

【问题讨论】:

    标签: python-3.x pandas group-by duplicates


    【解决方案1】:

    我相信需要drop_duplicates:

    df = df.drop_duplicates(['Year created', 'Week created'])
    print (df)
       Year created  Week created  SUM_New  SUM_Closed  SUM_Open
    0          2018             1       17           0        82
    1          2018             6       62          47        18
    

    【讨论】:

      【解决方案2】:
      df2 = df.drop_duplicates(['Year created', 'Week created', 'SUM_New', 'SUM_Closed'])
      print(df2)
      

      希望这会有所帮助。

      【讨论】:

        猜你喜欢
        • 2021-01-04
        • 2021-03-20
        • 2019-07-02
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2021-01-15
        • 1970-01-01
        相关资源
        最近更新 更多