【发布时间】:2018-01-28 11:22:58
【问题描述】:
我想使用类似于删除 DataFrame 的重复项的方法。我希望列的顺序无关紧要。我的意思是函数 shuold 认为由条目'a', 'b' 组成的行与由条目'b', 'a' 组成的行相同。例如,给定
df = pd.DataFrame([['a', 'b'], ['c', 'd'], ['a', 'b'], ['b', 'a']])
0 1
0 a b
1 c d
2 a b
3 b a
我想获得:
0 1
0 a b
1 c d
优先考虑效率,因为我在 groupby 操作中的巨大数据集上运行它。
【问题讨论】:
标签: python-3.x pandas dataframe data-cleaning drop-duplicates