【发布时间】:2012-06-21 11:14:30
【问题描述】:
我正在编写一个从不同网站的徽标中提取内容的程序。我正在使用 OCR 从徽标中提取文本,但我想优化程序并希望仅将 OCR 应用于那些具有文本但我不知道如何确定徽标是否包含文字???有什么方法吗??
【问题讨论】:
-
也许你可以试试机器学习。将图像缩小到 20×20 用标记数据训练分类器。图像有字母 1 或 -1。看看样本内错误和样本外错误有多好。如果准确率可以达到 90% 左右,那就值得使用。由于预测将非常容易,因此您只需要一些时间来训练并查看结果。 (libsvm 是你要开始的)
-
嗨 Fivesheep,感谢您的回复,但您是在谈论存储文本图像的训练图像吗?简单的 OCR 算法已经使用了这个.. 但是如果我输入一个复杂的图像,比如贝宝或 ebay 的徽标,它会输出随机值,事实上对于非基于文本的图像,它也会给出一个我不想但跳过图像的随机输出..我从code.google.com/p/opencms-backoffice/source/browse/… 获取了简单的 OCR 代码
标签: ocr