【发布时间】:2017-06-24 07:12:52
【问题描述】:
我正在学习 Tesseract OCR 并阅读基于 article 的 article。从第一篇文章开始:
第一步是自适应阈值,它将图像转换为 二进制图像。下一步是连通分量分析,即 用于提取字符轮廓。这个方法非常有用 因为它对带有白色文本和黑色背景的图像进行 OCR。 Tesseract 可能是第一个提供这种 加工。然后,将轮廓转换为 Blob。 Blob 被组织成文本行,而行和 针对某些固定区域或等效文本分析区域 大小。
谁能解释一下 Blob 是什么?
【问题讨论】: