【发布时间】:2019-11-24 05:41:19
【问题描述】:
假设我有一个这样的数据集:
我需要检查可能的重复项。在这里,第 2 行和第 3 行是可疑的重复项。我知道字符串距离方法以及数字变量的近似匹配。但是这两种方法是否结合在一起?最终,我正在寻找一种可以在 R 中实现的方法。
【问题讨论】:
-
第二行和第三行是否可能重复,因为它们的时间戳非常接近,它们的字符串相似,或两者兼而有之?
-
两者。实际上,在示例中,我还使
freq完全匹配。
标签: r join duplicates fuzzy-comparison record-linkage