【发布时间】:2014-05-09 11:43:38
【问题描述】:
我有一个巨大的数据框,由大约 7.000 行组成,每行都有一个特定的 ID 号,可以出现多次(最多 16 次)。在一个简单的版本中,它看起来像这样:
ID <- factor(c("a","a","a","a","b","c","c","d","d","d"))
var1 <-c(10,20,10,40,30,20,20,10,10,40)
var2 <-c(5,5,4,8,9,2,4,7,1,3)
df <- data.frame(ID,var1,var2)
df
ID var1 var2
1 a 10 5
2 a 20 5
3 a 10 4
4 a 40 8
5 b 30 9
6 c 20 2
7 c 20 4
8 d 10 7
9 d 10 1
10 d 40 3
现在我想以将具有相同 ID 的属性写入一行的方式形成我的data.frame,以便(在这种情况下)var1 最多有 4 列,var2 最多有 4 列,因为最频繁的 ID 出现了四次(ID a)。所有其他不存在数据的空格都应该用 填充。
生成的data.frame 应如下所示:
ID var1_1 var1_2 var1_3 var1_4 var2_1 var2_2 var2_3 var2_4
1 a 10 20 10 40 5 5 4 8
2 b 30 NA NA NA 9 NA NA NA
3 c 20 20 NA NA 2 4 NA NA
4 d 10 10 40 NA 7 1 3 NA
我的想法是通过tapply解决这个问题
df2 <- tapply (df$var1,df$ID,paste)
这给了我以下输出:
$a
[1] "10" "20" "10" "40"
$b
[1] "30"
$c
[1] "20" "20"
$d
[1] "10" "10" "40"
如果我将它转换为数据框,它看起来像这样:
> df3 <-as.data.frame(df2)
> df3
df3
a 10, 20, 10, 40
b 30
c 20, 20
d 10, 10, 40
问题是我现在只有一个变量而不是所需的四个。 (或者实际上是八个,关于那些由 var2 产生的,我会像 var1 一样处理并在最后一步通过合并进行合并)。
然后我尝试了strsplit(),但这并不能帮助我解决问题,因为我没有得到不同的列,而且我不知道如何添加 NA 值。
也许有一个简单的函数来重组data.frame?如果有人可以帮助我,我将非常幸运。
【问题讨论】:
-
你检查
reshape-function (stats-package)了吗? -
Rob 的忍者,但我也打算建议
reshape。 -
+1 表示可重复的问题,显示您尝试过的内容以及您希望看到的内容。
-
非常感谢您的帮助! :)