【发布时间】:2014-11-02 01:21:37
【问题描述】:
我使用 OCR(光学字符识别)从图像中获取文本。图像包含书籍封面。由于图像噪声太大,导致某些字符被误识别,或者某些噪声被识别为字符。
例子:
- “w COMPUTER Nnwonxs i I”(计算机网络)
- “s.ll NEURAL NETWORKS C”(神经网络)
- “1llllll INFRODUCIION ro PROBABILITY ti iitiiili My”(概率简介)
我用单词构建了一个字典,但我想以某种方式将识别的文本与字典匹配。我尝试了 LCS(最长公共子序列),但效果不佳。
这类问题最好的字符串匹配算法是什么? (所以字符串的一部分只是噪音,但字符串的重要部分也可能有一些误识别的字符)
【问题讨论】:
-
也许 Levenshtein 距离对于将“小破碎”单词与您的字典匹配有用吗?