【发布时间】:2013-02-03 20:48:09
【问题描述】:
我有一个 Pandas DataFrame,其中一组列的值重复。例如:
df = pd.DataFrame({'Column1': {0: 1, 1: 2, 2: 3}, 'Column2': {0: 'ABC', 1: 'XYZ', 2: 'ABC'}, 'Column3': {0: 'DEF', 1: 'DEF', 2: 'DEF'}, 'Column4': {0: 10, 1: 40, 2: 10})
In [2]: df
Out[2]:
Column1 Column2 Column3 Column4 is_duplicated dup_index
0 1 ABC DEF 10 False 0
1 2 XYZ DEF 40 False 1
2 3 ABC DEF 10 True 0
第 (1) 行和 (3) 行相同。本质上,第 (3) 行是第 (1) 行的副本。
我正在寻找以下输出:
Is_Duplicate,包含行是否重复[可以通过对dataframe列(Column2,Column3和Column4)使用“duplicated”方法来完成]
Dup_Index重复行的原始索引。
In [3]: df
Out[3]:
Column1 Column2 Column3 Column4 Is_Duplicate Dup_Index
0 1 ABC DEF 10 False 0
1 2 XYZ DEF 40 False 1
2 3 ABC DEF 10 True 0
【问题讨论】:
标签: python-2.7 dataframe pandas