【问题标题】:Merging two OCR trained data合并两个 OCR 训练数据
【发布时间】:2012-02-19 15:22:16
【问题描述】:

我正在尝试识别图像(表单)并转换为文本,目前使用来自谷歌“tesseract-ocr”的 egg.trained 数据,这适用于打印字符和手动编写的字符(由人手动编写)我开发了经过训练的数据,这对于我训练的角色来说效果很好。现在我想合并这两个训练数据(tesseract-ocr + 我自己训练的数据),这样我就可以在一个表单中识别手写字符和打印字符,请告诉我如何将这两个文件合并为一个。

【问题讨论】:

    标签: java linux ocr


    【解决方案1】:

    无需合并它们。 Tesseract 3.02 支持识别多种语言——例如,您可以指定“egg+eng+blah”作为 -l 选项的值。

    【讨论】:

    • 感谢回复,我使用的 Tesseract 3.01 不支持你提到的功能,有什么办法可以在 3.1 版中做同样的事情,或者我如何下载 tesseract,猜它不是官方的出来。
    • 你可以从code.google.com/p/tesseract-ocr/source/checkout查看源代码并构建3.02可执行文件。
    • 感谢您的时间,我尝试使用 SVN 并尝试下载,但它说不存在。命令:导出错误:URL 'tesseract-ocr.googlecode.com/svn/trunk/…' 错误:不存在已完成!:
    猜你喜欢
    • 2020-08-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-07-02
    • 1970-01-01
    • 1970-01-01
    • 2020-09-16
    • 1970-01-01
    相关资源
    最近更新 更多