【问题标题】:Row wise merge comma separated values in a `data.table`逐行合并“data.table”中的逗号分隔值
【发布时间】:2015-06-24 17:56:36
【问题描述】:

我有一个data.table DT 如下。

DT <- structure(list(ID = c("Bats", "HL", "JL", "Spidey", "Supes", 
"X"), List1 = c("Morrison, Brubaker, Daniel, Loeb", "David, Bryne, Lee", 
"", "Loeb, Lee", "Moore, Siegel, Millar", "Bendis, Whendon"), 
    List2 = c("Rucka, Kane, Morrison", "Lee, Mantlo, Bryne", 
    "Meltzer, Sekowsky, Morrison", "Waid, Yost, Kirby, Lee", 
    "", "Claremont, Whendon, Morrison")), .Names = c("ID", "List1", 
"List2"), row.names = c(NA, -6L), class = c("data.table", "data.frame"
), .internal.selfref = NULL, sorted = "ID")

DT

      ID                            List1                        List2
1:   Bats Morrison, Brubaker, Daniel, Loeb        Rucka, Kane, Morrison
2:     HL                David, Bryne, Lee           Lee, Mantlo, Bryne
3:     JL                                   Meltzer, Sekowsky, Morrison
4: Spidey                        Loeb, Lee       Waid, Yost, Kirby, Lee
5:  Supes            Moore, Siegel, Millar                             
6:      X                  Bendis, Whendon Claremont, Whendon, Morrison

我想将DT$List1DT$List2 列中的两个列表按行合并在一起,不重复。

我可以使用apply 执行此操作,如下所示。

DT$merged <- apply(DT,1,function(vec){
  paste(unique(strsplit(paste(vec[2],vec[3],sep=", "),", ")[[1]]),collapse=", ")
})

     DT
       ID                            List1                        List2
1:   Bats Morrison, Brubaker, Daniel, Loeb        Rucka, Kane, Morrison
2:     HL                David, Bryne, Lee           Lee, Mantlo, Bryne
3:     JL                                   Meltzer, Sekowsky, Morrison
4: Spidey                        Loeb, Lee       Waid, Yost, Kirby, Lee
5:  Supes            Moore, Siegel, Millar                             
6:      X                  Bendis, Whendon Claremont, Whendon, Morrison
                                          merged
1: Morrison, Brubaker, Daniel, Loeb, Rucka, Kane
2:                     David, Bryne, Lee, Mantlo
3:                 , Meltzer, Sekowsky, Morrison
4:                  Loeb, Lee, Waid, Yost, Kirby
5:                         Moore, Siegel, Millar
6:          Bendis, Whendon, Claremont, Morrison

由于单元格为空,如何使用data.table 在开头和结尾没有“,”的情况下有效地获得相同的结果?

【问题讨论】:

  • 我确信有更好的方法可以使用粘贴来执行此操作,但是您始终可以将其包装在 if-then 语句中,如果两列都有值,则使用该函数,但如果只有一个列有一个值,您只需使用该列中的数据即可。

标签: r data.table paste strsplit


【解决方案1】:
DT[, merged := toString(unique(c(strsplit(List1, split = ", ")[[1]],
                                 strsplit(List2, split = ", ")[[1]]))), by = ID][]
#       ID                            List1                        List2
#1:   Bats Morrison, Brubaker, Daniel, Loeb        Rucka, Kane, Morrison
#2:     HL                David, Bryne, Lee           Lee, Mantlo, Bryne
#3:     JL                                   Meltzer, Sekowsky, Morrison
#4: Spidey                        Loeb, Lee       Waid, Yost, Kirby, Lee
#5:  Supes            Moore, Siegel, Millar                             
#6:      X                  Bendis, Whendon Claremont, Whendon, Morrison
#                                          merged
#1: Morrison, Brubaker, Daniel, Loeb, Rucka, Kane
#2:                     David, Bryne, Lee, Mantlo
#3:                   Meltzer, Sekowsky, Morrison
#4:                  Loeb, Lee, Waid, Yost, Kirby
#5:                         Moore, Siegel, Millar
#6:          Bendis, Whendon, Claremont, Morrison

如果您的 ID 列不是唯一的,则将“by”替换为 1:nrow(DT)

【讨论】:

  • 代替unique(c(x,y))union(x,y) 似乎有效。就是这样,使用.SDDT[,merged := toString(Reduce(union,lapply(.SD,function(x) strsplit(x,split=", ")[[1]]))), by = ID][]
【解决方案2】:

试试

library(data.table)#v1.9.5+
DT[, merged := do.call(paste, c(.SD, sep=", ")), .SDcols= List1:List2
 ][, merged:=unlist(lapply(strsplit(merged, ", "),
          function(x)  toString(unique(x))))]   
#     ID                            List1                        List2
#1:   Bats Morrison, Brubaker, Daniel, Loeb        Rucka, Kane, Morrison
#2:     HL                David, Bryne, Lee           Lee, Mantlo, Bryne
#3:     JL                                   Meltzer, Sekowsky, Morrison
#4: Spidey                        Loeb, Lee       Waid, Yost, Kirby, Lee
#5:  Supes            Moore, Siegel, Millar                             
#6:      X                  Bendis, Whendon Claremont, Whendon, Morrison
#                                          merged
#1: Morrison, Brubaker, Daniel, Loeb, Rucka, Kane
#2:                     David, Bryne, Lee, Mantlo
#3:                 , Meltzer, Sekowsky, Morrison
#4:                  Loeb, Lee, Waid, Yost, Kirby
#5:                         Moore, Siegel, Millar
#6:          Bendis, Whendon, Claremont, Morrison

或者我们可以在do.call(paste 之后使用regex 来删除重复的元素

 DT[, merged := gsub('^,\\s*|(\\b\\S+\\b)(?=.*\\b\\1\\b.*),\\s*|,\\s*$', '',
     do.call(paste, c(.SD, sep=", ")), perl=TRUE), .SDcols = List1:List2]
#   ID                            List1                        List2
#1:   Bats Morrison, Brubaker, Daniel, Loeb        Rucka, Kane, Morrison
#2:     HL                David, Bryne, Lee           Lee, Mantlo, Bryne
#3:     JL                                   Meltzer, Sekowsky, Morrison
#4: Spidey                        Loeb, Lee       Waid, Yost, Kirby, Lee
#5:  Supes            Moore, Siegel, Millar                             
#6:      X                  Bendis, Whendon Claremont, Whendon, Morrison
 #                                         merged
#1: Brubaker, Daniel, Loeb, Rucka, Kane, Morrison
#2:                     David, Lee, Mantlo, Bryne
#3:                   Meltzer, Sekowsky, Morrison
#4:                  Loeb, Waid, Yost, Kirby, Lee
#5:                         Moore, Siegel, Millar
#6:          Bendis, Claremont, Whendon, Morrison

【讨论】:

    【解决方案3】:

    这可能是另一种方式

    DT[, merged:= paste(union(unlist(strsplit(List1, ', ')),
                  unlist(strsplit(List2, ', '))), collapse = ', '), by = ID]
    
    #> DT
    #       ID                            List1                        List2
    #1:   Bats Morrison, Brubaker, Daniel, Loeb        Rucka, Kane, Morrison
    #2:     HL                David, Bryne, Lee           Lee, Mantlo, Bryne
    #3:     JL                                   Meltzer, Sekowsky, Morrison
    #4: Spidey                        Loeb, Lee       Waid, Yost, Kirby, Lee
    #5:  Supes            Moore, Siegel, Millar                             
    #6:      X                  Bendis, Whendon Claremont, Whendon, Morrison
    #                                          merged
    #1: Morrison, Brubaker, Daniel, Loeb, Rucka, Kane
    #2:                     David, Bryne, Lee, Mantlo
    #3:                   Meltzer, Sekowsky, Morrison
    #4:                  Loeb, Lee, Waid, Yost, Kirby
    #5:                         Moore, Siegel, Millar
    #6:          Bendis, Whendon, Claremont, Morrison
    

    【讨论】:

      【解决方案4】:

      展示另一种方法的简单示例。函数trimComma 只是修剪掉开头和结尾的逗号。它还修剪重复的逗号,可以轻松地与paste一起使用

      trimComma <-function(x)
      {
          gsub(",,",",",gsub("^,+|,+$|","",x))
      }
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2023-01-20
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多