【发布时间】:2017-08-16 15:22:45
【问题描述】:
如果我有一个名字向量,比如说:
a = c("tom", "tommy", "alex", "tom", "alexis", "Alex", "jenny", "Al", "michell")
我想使用levenshteinSim 或类似方法来获得此向量内的相似度分数。但是,我不希望它自我评分。例如,"tom" #1 对 "tom" #3 得分。并且不要返回 "tom" #1 对 "tom" #1 的分数,所以不要自己评分。
我之前用两个不同的向量a 和b 完成了它。但是,如果我将它用于相同的向量,那么 "tom" #1 将与 "tom" #1 得分,这是我想要避免的。
有没有办法做到这一点?
【问题讨论】:
-
您希望输出的格式是什么?
标签: r levenshtein-distance fuzzy-logic stringdist record-linkage