【发布时间】:2017-06-28 03:05:51
【问题描述】:
从这个df出发的正确方法是什么:
>>> df=pd.DataFrame({'a':['jeff','bob','jill'], 'b':['bob','jeff','mike']})
>>> df
a b
0 jeff bob
1 bob jeff
2 jill mike
到这里:
>>> df2
a b
0 jeff bob
2 jill mike
您根据“a”和“b”中的项目删除重复行,而不考虑它们的特定列。
我可以使用 lambda 表达式创建一个掩码,然后根据掩码列删除重复项,但我认为必须有比这更简单的方法:
>>> df['c'] = df[['a', 'b']].apply(lambda x: ''.join(sorted((x[0], x[1]), \
key=lambda x: x[0]) + sorted((x[0], x[1]), key=lambda x: x[1] )), axis=1)
>>> df.drop_duplicates(subset='c', keep='first', inplace=True)
>>> df = df.iloc[:,:-1]
【问题讨论】:
标签: pandas