【发布时间】:2015-06-24 17:56:36
【问题描述】:
我有一个data.table DT 如下。
DT <- structure(list(ID = c("Bats", "HL", "JL", "Spidey", "Supes",
"X"), List1 = c("Morrison, Brubaker, Daniel, Loeb", "David, Bryne, Lee",
"", "Loeb, Lee", "Moore, Siegel, Millar", "Bendis, Whendon"),
List2 = c("Rucka, Kane, Morrison", "Lee, Mantlo, Bryne",
"Meltzer, Sekowsky, Morrison", "Waid, Yost, Kirby, Lee",
"", "Claremont, Whendon, Morrison")), .Names = c("ID", "List1",
"List2"), row.names = c(NA, -6L), class = c("data.table", "data.frame"
), .internal.selfref = NULL, sorted = "ID")
DT
ID List1 List2
1: Bats Morrison, Brubaker, Daniel, Loeb Rucka, Kane, Morrison
2: HL David, Bryne, Lee Lee, Mantlo, Bryne
3: JL Meltzer, Sekowsky, Morrison
4: Spidey Loeb, Lee Waid, Yost, Kirby, Lee
5: Supes Moore, Siegel, Millar
6: X Bendis, Whendon Claremont, Whendon, Morrison
我想将DT$List1 和DT$List2 列中的两个列表按行合并在一起,不重复。
我可以使用apply 执行此操作,如下所示。
DT$merged <- apply(DT,1,function(vec){
paste(unique(strsplit(paste(vec[2],vec[3],sep=", "),", ")[[1]]),collapse=", ")
})
DT
ID List1 List2
1: Bats Morrison, Brubaker, Daniel, Loeb Rucka, Kane, Morrison
2: HL David, Bryne, Lee Lee, Mantlo, Bryne
3: JL Meltzer, Sekowsky, Morrison
4: Spidey Loeb, Lee Waid, Yost, Kirby, Lee
5: Supes Moore, Siegel, Millar
6: X Bendis, Whendon Claremont, Whendon, Morrison
merged
1: Morrison, Brubaker, Daniel, Loeb, Rucka, Kane
2: David, Bryne, Lee, Mantlo
3: , Meltzer, Sekowsky, Morrison
4: Loeb, Lee, Waid, Yost, Kirby
5: Moore, Siegel, Millar
6: Bendis, Whendon, Claremont, Morrison
由于单元格为空,如何使用data.table 在开头和结尾没有“,”的情况下有效地获得相同的结果?
【问题讨论】:
-
我确信有更好的方法可以使用粘贴来执行此操作,但是您始终可以将其包装在 if-then 语句中,如果两列都有值,则使用该函数,但如果只有一个列有一个值,您只需使用该列中的数据即可。
标签: r data.table paste strsplit