【发布时间】:2015-02-23 22:28:42
【问题描述】:
我正在寻找一种方法来定位图像中的已知文本。
具体来说,我正在尝试创建一个工具,将一组扫描页面转换为支持搜索和复制+粘贴的 PDF。我了解这通常是如何完成的:OCR 页面,保留文本的位置,然后将文本作为不可见层添加到 PDF。 Acrobat 内置了这个功能,tesseract 可以输出 hOCR 文件(包含识别的文本及其位置),可以被 hocr2pdf 用来生成文本层。
不幸的是,我的源图像质量相当低(最多 150 DPI,有大量 JPEG 伪影,并且某些文本后面的背景不纯),导致 OCR 结果非常差。但是,我确实有每个页面上显示的文本(无图片和布局)的副本。
将已知文本与其在扫描页面上的位置相匹配似乎更容易准确地完成,但我没有发现任何内置此功能的软件。我如何利用现有软件来做到这一点?
编辑:文本的大小和字体各不相同,尽管其中的段落是一致的。
【问题讨论】:
-
你能发布一两个样本吗?你知道字体样式和大小的细节吗?这些在整个文档中是不变的吗?
-
您是否需要可以为您完成此任务的工具/软件?
-
@MarkSetchell 我无法发布确切的文档,但我会看看能否生成质量相当的样本。
-
@kkuilla,我正在开发一个用于处理这些文档的实用程序。我正在寻找可以在开箱即用的图像中定位已知文本的现有工具或库,或者关于如何使用一些较低级别的 api 自己实现它的建议。我只需要弄清楚如何在给定图像和文本的情况下获取每个字符的位置。剩下的我知道怎么做。
-
我会说这个问题可能是题外话,因为它是
"too broad"或"Questions asking us to recommend or find a book, tool, software library, tutorial or other off-site resource are off-topic for Stack Overflow as they tend to attract opinionated answers and spam. Instead, describe the problem and what has been done so far to solve it."请参阅How to ask
标签: image-processing ocr