【问题标题】:(pandas) Drop duplicates based on subset where order doesn't matter(熊猫)根据顺序无关紧要的子集删除重复项
【发布时间】:2017-06-28 03:05:51
【问题描述】:

从这个df出发的正确方法是什么:

>>> df=pd.DataFrame({'a':['jeff','bob','jill'], 'b':['bob','jeff','mike']})
>>> df
      a     b
0  jeff   bob
1   bob  jeff
2  jill  mike

到这里:

>>> df2
      a     b
0  jeff   bob
2  jill  mike

您根据“a”和“b”中的项目删除重复行,而不考虑它们的特定列。

我可以使用 lambda 表达式创建一个掩码,然后根据掩码列删除重复项,但我认为必须有比这更简单的方法:

>>> df['c'] = df[['a', 'b']].apply(lambda x: ''.join(sorted((x[0], x[1]), \
 key=lambda x: x[0]) + sorted((x[0], x[1]), key=lambda x: x[1] )), axis=1)
>>> df.drop_duplicates(subset='c', keep='first', inplace=True)
>>> df = df.iloc[:,:-1]

【问题讨论】:

    标签: pandas


    【解决方案1】:

    我认为您可以对每一行进行独立排序,然后使用 duplicated 查看要删除的行。

    dupes = df.apply(lambda x: x.sort_values().values, axis=1).duplicated()
    df[~dupes]
    

    一种更快的上当受骗方式。感谢@DSM。

    dupes = df.T.apply(sorted).T.duplicated()
    

    【讨论】:

    • 你能用sorted代替lambda吗?
    【解决方案2】:

    我认为最简单的方法是使用applyaxis=1 按行排序,然后调用DataFrame.duplicated

    df = df[~df.apply(sorted, 1).duplicated()]
    print (df)
          a     b
    0  jeff   bob
    2  jill  mike
    

    使用numpy.sortDataFrame 构造函数有点复杂,但非常快:

    df1 = pd.DataFrame(np.sort(df.values, axis=1), index=df.index, columns=df.columns)
    df = df[~df1.duplicated()]
    print (df)
          a     b
    0  jeff   bob
    2  jill  mike
    

    时间安排

    np.random.seed(123)
    N = 10000
    df = pd.DataFrame({'A': np.random.randint(100,size=N).astype(str),
                       'B': np.random.randint(100,size=N).astype(str)})
    #print (df)
    
    In [63]: %timeit (df[~pd.DataFrame(np.sort(df.values, axis=1), index=df.index, columns=df.columns).duplicated()])
    100 loops, best of 3: 3.25 ms per loop
    
    In [64]: %timeit (df[~df.apply(sorted, 1).duplicated()])
    1 loop, best of 3: 1.09 s per loop
    
    #Ted Petrou solution1
    In [65]: %timeit (df[~df.apply(lambda x: x.sort_values().values, axis=1).duplicated()])
    1 loop, best of 3: 2.89 s per loop
    
    #Ted Petrou solution2
    In [66]: %timeit (df[~df.T.apply(sorted).T.duplicated()])
    1 loop, best of 3: 1.56 s per loop
    

    【讨论】:

      猜你喜欢
      • 2020-01-20
      • 1970-01-01
      • 2018-07-09
      • 2023-01-03
      • 2023-01-11
      • 2019-04-19
      • 2020-09-21
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多