【发布时间】:2011-04-30 22:27:32
【问题描述】:
有人给了我一大堆惊人的信息。它是 200MB .tiff 扫描公告的图像,可以追溯到 40 年代。我想把它数字化,但我对 OCR 一无所知。一些早期的材料几乎无法被人类阅读,更不用说机器了。它也是希伯来语。
我正在寻找有关如何解决此问题的建议。关于书籍、文章、代码库或软件的好建议(所有这些都应该在网络上免费提供)。我精通 C++ 和 Python,如果需要,可以选择另一种语言。
谢谢。
【问题讨论】:
-
您需要它可搜索吗?如果没有,请保持原样,因为这样可能会更有用。我从未见过 great OCR(尽管有些接近)英语;我想扫描希伯来语的错误率会高得多。
-
如果人类几乎无法阅读,那么机器可以阅读它的可能性很小。
-
从 40 年代初到 60 年代的东西可能无法被机器读取,但至少从 70 年代到现在的所有东西都应该是。
标签: ocr