【问题标题】:unique / sort in data.frame在data.frame中唯一/排序
【发布时间】:2012-10-29 21:02:42
【问题描述】:

我有一个这样的数据框:

x=c("01","01","01","22","22","03","03","03","35","35")
y=c("f","f","f","m","m","m","m","m","f","f")
df=data.frame(spn=x, sex=y)

好像:

   spn sex
1   01   f
2   01   f
3   01   f
4   22   m
5   22   m
6   03   m
7   03   m
8   03   m
9   35   f
10  35   f

我想做的是对 df$spn 进行排序,让它只出现一次。适当的 df$sex 也是如此,例如:

   spn sex
1  01   f
2  03   m
3  22   m
4  35   f

我怎么能这样做?非常感谢!

【问题讨论】:

    标签: r unique dataframe


    【解决方案1】:
    df <- df[order(df$spn), ]
    > df[!duplicated(df), ]
      spn sex
    1  01   f
    6  03   m
    4  22   m
    9  35   f
    

    【讨论】:

      【解决方案2】:
      df2 = df[!duplicated(df), ] # Remove duplicated rows.
      df3 = df2[order(df2$spn), ] # Sort by the spn column.
      
      df3
      #  spn sex
      #1  01   f
      #6  03   m
      #4  22   m
      #9  35   f
      

      【讨论】:

      • 从效率的角度来看,先去掉重复确实更快。
      【解决方案3】:

      使用唯一的然后排序:

      df <- unique(df)
      df[order(df$spn), ]
      

      使用dplyrdata.table

      library(dplyr)
      unique(df) %>% arrange(spn)
      #   spn sex
      # 1  01   f
      # 2  03   m
      # 3  22   m
      # 4  35   f
      
      library(data.table)
      unique(setDT(df))[ order(spn), ]
      #    spn sex
      # 1:  01   f
      # 2:  03   m
      # 3:  22   m
      # 4:  35   f
      

      【讨论】:

      • 可以用一行代码写出来吗?我希望在 ggplot scale_y_continuous(label=c(
      • @MeenakshiSundharam 请发布a new question,并附上示例数据、您的ggplot代码和预期输出。
      猜你喜欢
      • 2018-11-21
      • 2014-01-07
      • 2017-02-08
      • 2013-02-21
      • 1970-01-01
      • 2021-12-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多