【发布时间】:2011-04-14 11:49:28
【问题描述】:
我有两个必须比较相似性的字符串。该算法必须设计为找到最大相似度。在这种情况下,顺序很重要,但中间(或丢失)字符不重要。由于各种原因,在这种情况下无法使用编辑距离。
情况基本如下:
string 1: ABCDEFG
string 2: AFENBCDGRDLFG
生成的算法将找到子字符串A、BCD、FG
我目前有一个递归解决方案,但因为这必须在大量数据上运行,任何改进都将不胜感激
【问题讨论】:
-
您能发表一下您当前的递归解决方案的描述吗?
-
你有这方面的语言吗?
-
只是我,还是这个 NP 难?
-
@Peter:我删除
substring标签的原因是子字符串总是连续的。你想要的是一个不需要连续的子序列。 -
这里“E”不也是常用子串吗?
标签: algorithm string pattern-matching substring