【发布时间】:2019-07-02 16:32:51
【问题描述】:
我有一个包含 3 列的数据集:ID、值 a 和值 b。我想根据 ID 列中的值对数据集进行分组,然后识别在不同分组之间的值 a 和 b 列中具有相同数据的重复项。
我知道我可以使用 dplyr 包和数据 %>% group_by (ID) 根据 ID 列对我的数据集进行分组。我也知道我可以使用 data[duplicated(data[,2:3]),] 返回第 2 行(值 a)和第 3 行(值 b)中具有重复数据的所有行。
但是,我想要一个只能查找不同 ID 组之间的重复项而不是整个数据集中的重复项的函数。我试过组合 group_by 和 duplicated,但它没有返回正确的结果。哪个函数可以做到这一点?
【问题讨论】:
-
这样的事情将适用于您的情况
dt %>% distinct(ID, a, b),因为您有 3 列,所有列都将用于发现您的重复项。 -
你可以提供一个可重现的例子,告诉你想要什么结果
标签: r