【发布时间】:2018-04-19 04:33:45
【问题描述】:
library(tidyverse)
这个问题的灵感来自 Jake Kaupp 对问题 “tidyr/dplyr - 为重复的 ids 传播多个变量”的回答。使用提供的示例数据(底部),我希望每行只有一个 ID,但是有一些重复 ID 的实例(148 和 188)。由于有不同的电话号码,我想动态地分散这些号码,以便每个号码都有一列。在我的真实数据集中,我不确定会有多少重复的 ID,这会不断变化。我想在 Tidyverse 中完成所有这些,但我被困住了:
首先,我使用下面的代码来找到所需的最大列数...
cols <-Df %>%
group_by(Id) %>%
group_size() %>%
max()
接下来,我想做类似下面的代码,但不推荐使用“separate_”。我不确定在这里使用什么?我用 tidyr::spread 尝试了各种尝试,并查看了解决重复标识符的其他选项,例如添加索引列 (mutate(I=row_numbers()),但也无法使其正常工作。
Df%>%
group_by(Id) %>%
separate_("Ph1", paste0("1:3", 1:cols), sep = ",", fill = "right")
有没有一种简单的方法可以做到这一点?动态方面很重要,因为数据集总是会发生变化,最终我想将这部分作为函数的一部分。
样本数据:
Id<-c(199,148,148,145,177,165,144,121,188,188,188,111)
Ph1<-c(6532881717,6572231223,6541132112,6457886543,6548887777,7372222222,6451123425,6783450101,7890986543,6785554444,8764443344,6453348736)
Ph2<-c(NA,NA,NA,NA,NA,7372222222,NA,NA,NA,6785554444,NA,NA)
Df<-data.frame(Id,Ph1,Ph2)
【问题讨论】: