【发布时间】:2018-12-16 17:27:08
【问题描述】:
在 Python 中是否有任何函数可以接受多行字符串并返回它们具有多少相似度的百分比? SequenceMatcher 之类的东西,但适用于多个字符串。
例如我们有以下句子
Hello how are you?
Hi how are you?
hi how are you doing?
Hey how is your day?
我希望能够根据句子彼此的相似程度得到一个百分比
假设我们有这三个句子
Hello how are you?
Hello how are you?
Hello how are you?
那么我们应该得到 100% 的相似度
但是如果我们有
Hello how are you?
Hello how are you?
hola como estats?
那么我们应该得到一个相似度约为 67% 的数字。
【问题讨论】:
-
也许您可以提供更多信息?到目前为止,您尝试了哪些代码,预期的输出是什么?
-
您可以使用
map和itertools.product来构建相似度矩阵。不过,您必须定义自己的指标:map(metric, product(strings, strings))。 -
只是想建议
difflib,但显然你已经知道了。除了比较所有对的成对相似性之外,多个字符串的相似性应该如何工作?你能展示一些示例输入/输出吗? -
它应该根据我们拥有的总句子返回一个数字(这是它们相似程度的百分比)。我将更新问题以改进我的示例
-
你的第二个例子“大约 67%”怎么样?那是一对具有完全相似性的对和两对具有非常低相似性的对。对我来说,这更像是 35-40% 的相似性。还是你也想考虑句子意思的相似度,而不是单纯的单词和字母的相似度?
标签: python string similarity sentence-similarity