【发布时间】:2019-07-08 10:38:01
【问题描述】:
我有一个包含日期和公司名称的数据集。我只想保留行,以便公司名称和日期的组合至少出现在数据集中两次。
为了说明问题,让我们假设我有以下数据框:
df1 = pd.DataFrame(np.array([['28/02/2017', 'Apple'], ['28/02/2017', 'Apple'], ['31/03/2017', 'Apple'],['28/02/2017', 'IBM'],['28/02/2017', 'WalMart'],
['28/02/2017', 'WalMart'],['03/07/2017', 'WalMart']]), columns=['date','keyword'])
我想要的输出是:
df2 = pd.DataFrame(np.array([['28/02/2017', 'Apple'], ['28/02/2017', 'Apple'],
['28/02/2017', 'WalMart'],
['28/02/2017', 'WalMart']]), columns=['date', 'keyword'])
我知道如何根据两列中的条件删除行,但我不知道如何根据数据集中两个值的组合出现的次数来删除行。
谁能提供一些见解?
【问题讨论】: