【问题标题】:How to remove identical rows in a large data.frame [duplicate]如何删除大型data.frame中的相同行[重复]
【发布时间】:2013-03-12 12:23:02
【问题描述】:

我有一个如下所示的 data.frame:

GN  PN  
a   3.4   
a   3.4   
a   9.8   
d   8.4   
e   9 
e   6.5

我想要以下输出:

GN  PN  
a   3.4   
a   9.8   
d   8.4   
e   9 
e   6.5

(相同的行将被删除!)

我正在尝试使用发布在:multiple columns comparison 中的代码,但没有成功,因为复制的行 (a 3.4) 仍然存在。我有一个很大的 data.frame(大约 66.000 行和 10 列)。

真实案例:

 GN     SP                PN
A1CF   52573692   TCGA-B6-A0RS-01A-11D-A099
A1CF   52595854   TCGA-BH-A0HP-01A-12D-A099 
A1CF   52595854   TCGA-BH-A0HP-01A-12D-A099
A1CF   52595937   TCGA-BH-A18P-01A-11D-A12B
A2BP1  7568361    TCGA-D8-A1JN-01A-11D-A13L
A2BP1  7102099    TCGA-E2-A1BC-01A-11D-A14G
A2BP1  7102099    TCGA-E2-A1BC-01A-11D-A14G
A2BP1  7383011    TCGA-AR-A1AJ-01A-21D-A12Q
A2BP1  7383011    TCGA-AR-A1AJ-01A-21D-A12Q
A2BP1  7568188    TCGA-BH-A18J-01A-11D-A12B
A2BP1  7629860    TCGA-AO-A03O-01A-11W-A019
A2BP1  7629860    TCGA-AO-A03O-01A-11W-A019

【问题讨论】:

标签: r


【解决方案1】:

也许你可以试试new.df=subset(df,!duplicate(df))

【讨论】:

  • 刚刚发布了真实案例!
【解决方案2】:

只需使用:

 unique(df)

这给出了:

  GN  PN
1  a 3.4
3  a 9.8
4  d 8.4
5  e 9.0
6  e 6.5

【讨论】:

  • 不幸的是它不起作用..
  • 您能详细说明一下吗?它适用于您的示例...
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2020-07-27
  • 1970-01-01
  • 1970-01-01
  • 2016-08-13
  • 2017-03-02
  • 2015-09-29
  • 1970-01-01
相关资源
最近更新 更多