【问题标题】:Creating a new dataframe with only 1 row per value创建一个新的数据框,每个值只有 1 行
【发布时间】:2017-07-07 12:33:21
【问题描述】:

我正在尝试用原始数据框(数据框 1)中的行填充熊猫数据框(数据框 2)。我在下面创建了一个模拟 Dataframe 1:

Ref Number  Name
1           Alpha
2           Alpha
3           Alpha
4           Alpha
5           Beta
6           Beta
7           Beta
8           Charlie

我想删除先前行中出现值 Name 的行。 IE。数据框 2 应该看起来像

Ref Number  Name
1           Alpha
5           Beta
8           Charlie

在这种情况下,参考编号无关紧要。在我的工作文件中,我计划添加一列来指定某些内容,然后在应用某些功能时引用它。

我将如何使用 Pandas 解决这个问题?我有一个约 5000 行的 CSV,我想将其限制为约 1000 的第二个数据帧。

【问题讨论】:

  • “参考编号无关紧要”是什么意思?是多余的吗?在那种情况下,为什么要使用表格格式呢?您只需要一组值,即set(df["Name"])

标签: python pandas


【解决方案1】:

使用drop_duplicates 指定列Name 来查找重复项:

df = df.drop_duplicates('Name')
print (df)
   Ref Number     Name
0           1    Alpha
4           5     Beta
7           8  Charlie

【讨论】:

  • 谢谢!已添加!
  • 我们应该可以找到一个像样的duplicate..
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2021-11-17
  • 1970-01-01
  • 1970-01-01
  • 2021-06-16
  • 1970-01-01
  • 1970-01-01
  • 2021-10-17
相关资源
最近更新 更多