【问题标题】:Introduction to OCROCR 简介
【发布时间】:2011-04-30 22:27:32
【问题描述】:

有人给了我一大堆惊人的信息。它是 200MB .tiff 扫描公告的图像,可以追溯到 40 年代。我想把它数字化,但我对 OCR 一无所知。一些早期的材料几乎无法被人类阅读,更不用说机器了。它也是希伯来语。

我正在寻找有关如何解决此问题的建议。关于书籍、文章、代码库或软件的好建议(所有这些都应该在网络上免费提供)。我精通 C++ 和 Python,如果需要,可以选择另一种语言。

谢谢。

【问题讨论】:

  • 您需要它可搜索吗?如果没有,请保持原样,因为这样可能会更有用。我从未见过 great OCR(尽管有些接近)英语;我想扫描希伯来语的错误率会高得多。
  • 如果人类几乎无法阅读,那么机器可以阅读它的可能性很小。
  • 从 40 年代初到 60 年代的东西可能无法被机器读取,但至少从 70 年代到现在的所有东西都应该是。

标签: ocr


【解决方案1】:

这听起来像是 Python 的一项伟大任务,使用 OCR 库。一个快速的谷歌搜索出现了pytesser

PyTesser 是 Python 的光学字符识别模块。它将图像或图像文件作为输入并输出一个字符串。

PyTesser 使用Tesseract OCR engine,将图像转换为可接受的格式,并将 Tesseract 可执行文件作为外部脚本调用。随 Python 脚本一起提供了一个 Windows 可执行文件。这些脚本也应该可以在其他操作系统中运行。

...

使用示例

>>> from pytesser import *
>>> image = Image.open('fnord.tif')  # Open image object using PIL
>>> print image_to_string(image)     # Run tesseract.exe on image
fnord
>>> print image_file_to_string('fnord.tif')
fnord

【讨论】:

  • pytesser 支持希伯来语吗?
  • 好点 - tesseract 支持a lot of languages,但我看不到希伯来语。看起来对 OCRing 希伯来语的兴趣/支持相对较少。
  • 我发现 hocr (hocr.berlios.de) 和 qhocr (code.google.com/p/qhocr) 可能会有所帮助。虽然我正在寻找更多信息和方向 - 基本上什么是通用 OCR 算法?如果我向库提供所使用的字体(或模拟类似的字体),它将对算法有益吗?
  • @CamelCamelCamel 看起来像是在 2012 年 10 月向 Tesseract 添加了希伯来语支持。
猜你喜欢
  • 2017-02-21
  • 2014-03-18
  • 2016-11-11
  • 2011-01-26
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2014-03-09
  • 2011-05-11
相关资源
最近更新 更多