【问题标题】:Can I use OCR to detect font style (bold, italic)? [closed]我可以使用 OCR 检测字体样式(粗体、斜体)吗? [关闭]
【发布时间】:2011-07-07 00:09:46
【问题描述】:

我对使用 OCR 从简单文本中提取粗体和斜体字感兴趣。例如,如果我输入带有如下文本的清晰图像:

“敏捷的棕色狐狸超过了懒惰的狗。”

我想得到这样的输出:bold("brown", "jumps"), italic("lazy")

我已经研究过使用 OCRopus 或 Tesseract 来做这件事,但是文档很差,我不知道这是否可行,或者如果可以的话该怎么做。

【问题讨论】:

标签: ocr font-face tesseract


【解决方案1】:

Tesseract 3.0.1 中有这样的功能,来自trunk。 API 中添加了一个新类 - ResultIterator,它具有以下您感兴趣的功能:

 WordFontAttributes(bool* is_bold,
                    bool* is_italic,
                    bool* is_underlined,
                    bool* is_monospace,
                    bool* is_serif,
                    bool* is_smallcaps,
                    int* pointsize,
                    int* font_id).  

其实你可以在here.看到自己

【解决方案2】:

Tesseract 3.0x 基于 XML 的 hOCR 格式包括字符属性。您可能想尝试一下。

http://code.google.com/p/tesseract-ocr/issues/detail?id=377#c5

【讨论】:

    猜你喜欢
    • 2012-02-26
    • 1970-01-01
    • 2013-01-07
    • 1970-01-01
    • 2011-07-18
    • 2011-10-02
    • 2013-05-17
    • 2016-06-26
    • 1970-01-01
    相关资源
    最近更新 更多