【发布时间】:2011-02-20 20:23:35
【问题描述】:
Levenshtein 距离为我们提供了一种根据无序单个字符计算两个相似字符串之间距离的方法:
快速棕色狐狸 quikc 棕色传真Levenshtein 距离 = 3。
具有相似子序列的两个字符串之间的距离的相似算法是什么? 例如,在
快棕色狐狸 棕色狐狸Levenshtein 距离是 10,但这并没有考虑到字符串有两个相似的子序列,这使得它们比完全无序的单词 like 更“相似”
快棕色狐狸 qburiocwknfox然而这个完全无序的版本的 Levenshtein 距离为 8。
存在哪些距离度量会考虑子序列的长度,而不假设子序列可以很容易地分解成不同的单词?
【问题讨论】:
-
这怎么跑题了?也许可以改进标题。
-
以更好的名字被问了很多次 :o) stackoverflow.com/questions/451884/similar-string-algorithm 或 stackoverflow.com/questions/653157/… 或 stackoverflow.com/questions/246961/… 顺便说一句:我特别喜欢基于压缩距离的想法。
-
@Dario:你会建议什么标题?
-
@MaR:这些问题与这个问题不同。关键是没有明显的方法可以将字符串分解成单词。
-
比较不同字符串相似度指标的另一个有趣页面:dcs.shef.ac.uk/~sam/stringmetrics.html 在此比较中,最好的似乎是 SmithWatermanGotoh 指标。
标签: algorithm