【发布时间】:2018-12-12 06:17:24
【问题描述】:
示例数据如下图,
1) 我需要删除在Month0 中记录了多个GroupID 的人(IDs)。例如,FGH 不应包含在我的分析中。
2) 我想计算从第 0 个月到第 4 个月(第 1 个月、第 2 个月、第 3 个月和第 4 个月)连续拥有相同 GroupID 的人(唯一 IDs)的百分比。 (例如 ID ABC 符合此标准,即使它们在第 1 个月记录了两个组 ID)。
(ID实际上是9位数字)。有些 ID 每个月都有几个组 ID(例如 YUI)。
ID Month GroupID
ABC 0 390988
ABC 1 390988
ABC 1 934667
ABC 2 390988
ABC 3 390988
ABC 4 390988
FGH 0 678743
FGH 0 789555
FGH 1 678666
FGH 2 678666
FGH 2 982342
YUI 0 989000
YUI 1 567099
YUI 2 873467
YUI 3 567099
YUI 3 348938
YUI 4 567099
我对 R 有点陌生,我正在寻找 dplyr/ tidyverse 解决这个看似简单的操作的方法。任何帮助表示赞赏!
【问题讨论】:
-
您可以发布示例数据吗?请使用
dput(df1)的输出编辑问题。或者,如果dput(head(df1, 20))的输出太大。 -
我已经扩展了数据和问题,谢谢!
标签: r dplyr duplicates tidyverse data-manipulation