【发布时间】:2021-04-26 16:01:03
【问题描述】:
我想从数据框列中找到与指定字符串最相似的值,例如a='book'。假设数据框看起来像:df
col1
wijk 00 book
Wijk a
test
现在我想返回wijk 00 book,因为它与a 最相似。我正在尝试使用 fuzzywuzzy 包来做到这一点。
因此,我有一个数据框A,其中包含我想要类似的值。然后我使用:
A['similar_value'] = A.col1.apply(lambda x: [process.extract(x, df.col1, limit=1)][0][0][0])
但是当比较很多字符串时,这会花费太多时间。有谁知道如何快速做到这一点?
【问题讨论】:
-
你如何定义相似度?
-
@ZalakBhalani 数据框列中的字符串应包含字符串
a -
fuzzywuzzy的当前代码是什么?我们可以尝试优化它 -
我添加了我的代码
-
流程变量定义为什么?
标签: python pandas fuzzywuzzy