【问题标题】:OCR algorithm- distinguish between textual image and object imageOCR算法——区分文本图像和物体图像
【发布时间】:2012-06-21 11:14:30
【问题描述】:

我正在编写一个从不同网站的徽标中提取内容的程序。我正在使用 OCR 从徽标中提取文本,但我想优化程序并希望仅将 OCR 应用于那些具有文本但我不知道如何确定徽标是否包含文字???有什么方法吗??

【问题讨论】:

  • 也许你可以试试机器学习。将图像缩小到 20×20 用标记数据训练分类器。图像有字母 1 或 -1。看看样本内错误和样本外错误有多好。如果准确率可以达到 90% 左右,那就值得使用。由于预测将非常容易,因此您只需要一些时间来训练并查看结果。 (libsvm 是你要开始的)
  • 嗨 Fivesheep,感谢您的回复,但您是在谈论存储文本图像的训练图像吗?简单的 OCR 算法已经使用了这个.. 但是如果我输入一个复杂的图像,比如贝宝或 ebay 的徽标,它会输出随机值,事实上对于非基于文本的图像,它也会给出一个我不想但跳过图像的随机输出..我从code.google.com/p/opencms-backoffice/source/browse/… 获取了简单的 OCR 代码

标签: ocr


【解决方案1】:

在这种情况下,我们需要知道图像中是否包含文本。它与 OCR 不同。

目前被认为最好的算法是笔画宽度变换。它是由微软旗下的 Ephstein 于 2010 年设计的。它没有使用任何机器学习的目的。

您可以从这篇论文中获得更多详细信息:Detecting Text in Natural Scenes with Stroke Width Transform

Or watch a video about this.

这个算法有一个实现here

【讨论】:

  • 感谢 Abid Rahman K.. 正在处理它.. 代码是 C++ 但我正在使用 java.. 会有可用的 java 代码吗?
  • 对不起,因为我在 SOF 的声誉,我不能为你的答案投票。
  • 关于java代码,我不知道有没有。其实它是在microsoft下的,正如你在视频中看到的,如果你需要真正的代码,你需要在microsoft。除了极少数论文之外,很难找到关于 SWT 的足够详细信息。
猜你喜欢
  • 2012-10-26
  • 2017-04-21
  • 1970-01-01
  • 1970-01-01
  • 2017-12-15
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-06-14
相关资源
最近更新 更多