【发布时间】:2012-02-19 15:22:16
【问题描述】:
我正在尝试识别图像(表单)并转换为文本,目前使用来自谷歌“tesseract-ocr”的 egg.trained 数据,这适用于打印字符和手动编写的字符(由人手动编写)我开发了经过训练的数据,这对于我训练的角色来说效果很好。现在我想合并这两个训练数据(tesseract-ocr + 我自己训练的数据),这样我就可以在一个表单中识别手写字符和打印字符,请告诉我如何将这两个文件合并为一个。
【问题讨论】:
我正在尝试识别图像(表单)并转换为文本,目前使用来自谷歌“tesseract-ocr”的 egg.trained 数据,这适用于打印字符和手动编写的字符(由人手动编写)我开发了经过训练的数据,这对于我训练的角色来说效果很好。现在我想合并这两个训练数据(tesseract-ocr + 我自己训练的数据),这样我就可以在一个表单中识别手写字符和打印字符,请告诉我如何将这两个文件合并为一个。
【问题讨论】:
无需合并它们。 Tesseract 3.02 支持识别多种语言——例如,您可以指定“egg+eng+blah”作为 -l 选项的值。
【讨论】: