【发布时间】:2015-03-08 12:00:21
【问题描述】:
我在 Fraktur font 中有一个文档,并使用 tesseract 执行了 OCR(语言为 deu-frak)。我花了大约 10 天(一天 24 小时)来转换这 23 期(每期大约 400 页)。
结果是一个可搜索的 PDF,其中嵌入了原始图像和顶部的不可见文本:
现在,我删除了带有Master PDF Editor 的图像,并将文本类型从“不可见”更改为“全文”。现在事实证明,有些单词没有被 tesseract 识别,所以每个字母都是分开定位的: 请注意,“kommen”被识别为单词,但“fruchtbaren”仅被识别为字符序列。这使得无法通过文本搜索找到“fruchtbaren”,并且在更改字体大小时,字母重叠或产生难看的间隙。
我正在使用 Linux 并寻找一个命令行工具,它允许编写所有 23 个 PDF 文档的脚本。
是否有可能以最小距离连接文本框,或者甚至连接一条线会很棒?
谢谢。
【问题讨论】:
-
这使得无法找到“furchtbaren” - 您知道文本是“fruchtbaren”,而不是“furchtbaren”吗?
-
大声笑......是的,你是对的,这是一个错字 - 我会更正它。但问题是关于每个字母的文本框,我想将它们组合成单词。
标签: linux pdf textbox ocr tesseract