【发布时间】:2019-10-10 17:16:04
【问题描述】:
这是一个非常模糊的问题,但我想知道 R 中是否有某种函数或包可以合并或识别两列或多列中相似/相同的观察结果(甚至可能评估每个观察结果彼此之间的相似程度) .我有两个凌乱的数据集,其中一些列具有一些唯一标识符,但两者之间有很多拼写或小的差异。例如,您有一个这样的列:
c1 <- c("ELIZA 2A", "aaab", "Unique New York", "I slith the Sheeth", "fdasa", "Yellow leather")
c2<- c("ELIZA", "fjdkaldjlk", "Unique NY", "Slith Sheeth", "Y. Leather")
在这种情况下,c1 中的第 1、3、4 和 6 个元素与 c2 中的第 1、3、4、5 个元素相似。我想要某种函数或算法来显示它,也许显示它们有多相似,然后通过 c1 或 c2 合并它们。这些数据集有超过 15,000 个观察值,行更杂乱,但这只是一个例子。我希望这是有道理的。
感谢您的帮助!
【问题讨论】:
-
这种事情总是很棘手。看看基础 R 中的
adist和stringdist包。