【发布时间】:2019-07-05 17:17:31
【问题描述】:
我正在尝试从我的数据框中删除一个错误的重复项,其中重复的行(例如下面的患者 ID 1 和 3)没有信息 (NA)。
需要删除的重复项总是首先出现在对中,所以我正在考虑以某种方式使用该信息来删除它们。
已简化以下数据以稍微减少问题(注意:我正在寻找一种可以在大型数据集中删除多个重复项而无需手动识别它们的函数):
到目前为止,我一直在尝试处理以下代码:
test <- ea2[!duplicated(ea2[,c("PatientID", "SessionDate2")]),]
但这当然只是删除了患者 ID 1 和 3 的第二个重复行,我需要将其保留在数据集中。
【问题讨论】:
-
您可能需要
ea2[!(duplicated(ea2[,c("PatientID", "SessionDate2")]|duplicated(ea2[,c("PatientID", "SessionDate2")], fromLast = TRUE),]
标签: r date duplicates