【问题标题】:Order mismatch and similarity订单不匹配和相似性
【发布时间】:2021-09-29 15:50:56
【问题描述】:

我有两个值,它们的顺序不匹配,并且值在理想情况下是相同的。
当我计算字符串相似度时,它们之间的分数与理想分数相差甚远

col_1 = c("USA,UK,APAC")
col_2 = c("UK,APAC,USA")
library(stringdist)
stringdist(col_1,col_2,  method = 'jw')

如何识别 col_1 和 col_2 相似,即使它们的顺序排列错误。即有没有任何方法可以识别两个值在理想情况下是相同的

【问题讨论】:

    标签: r dplyr stringdist


    【解决方案1】:

    如果您的值始终用逗号分隔,则可以按逗号分隔,排序然后比较它们。

    spl_1 <- sort(unlist(strsplit(col_1, ',')))
    spl_2 <- sort(unlist(strsplit(col_2, ',')))
    
    stringdist(spl_1, spl_2, method = "jw")
    
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-05-29
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多