【发布时间】:2018-04-03 14:52:47
【问题描述】:
我有一个数据集,我需要在其中根据多列中的数据查找重复项。下面是一个示例,数据类型为 int、date、int。
有点像
DF1 <- data.frame(ID=c('1','1','3','4','3' ),
Date=c('01-04-2016','01-05-2016','01-04-2016','01-06-2016', '01-04-2016'),
Sale=c('1000','1000','1000','2000', '1000'))
我知道我可以使用重复的命令根据以下 1 个变量查找受骗者
DF1$dupes <- duplicated(DF1$ID)
但是当我包含多个变量时,例如:
DF1$dupes <- duplicated(DF1, c("ID", "Date", "Sale"))
我得到两个错误
argument 'incomparables != FALSE' is not used (yet)
和
'fromLast' must be TRUE or FALSE
有人可以向我解释一下这些是什么意思吗?我在 ?duplicated 和许多在线网站上阅读了文档,其中大部分是帮助文档的副本。
无与伦比 -
- 无法比较的值向量。 FALSE 是一个特殊的值, 意味着可以比较所有值,并且可能是唯一的值 接受除默认值以外的方法。会被强制 内部为与 x 相同的类型。
从上一个 -
- 逻辑指示是否应从 反面,即相同元素的最后一个(或最右边) 将对应于重复 = FALSE。
两件事:
- 谁能解释为什么它不起作用?我不明白,理解会有所帮助。
- 还有其他方法可以识别它们吗?我不想删除它们,我想在数据框中标识它们,一个简单的 1/0 就可以了。
感谢您的帮助,谢谢。
【问题讨论】:
-
我认为有一些错误您需要对数据集的列进行子集化,然后应用重复的
duplicated(DF1[ c("ID", "Date", "Sale")])
标签: r duplicates