【问题标题】:Connect textboxes in PDF automatically自动连接 PDF 中的文本框
【发布时间】:2015-03-08 12:00:21
【问题描述】:

我在 Fraktur font 中有一个文档,并使用 tesseract 执行了 OCR(语言为 deu-frak)。我花了大约 10 天(一天 24 小时)来转换这 23 期(每期大约 400 页)。

结果是一个可搜索的 PDF,其中嵌入了原始图像和顶部的不可见文本:

现在,我删除了带有Master PDF Editor 的图像,并将文本类型从“不可见”更改为“全文”。现在事实证明,有些单词没有被 tesseract 识别,所以每个字母都是分开定位的: 请注意,“kommen”被识别为单词,但“fruchtbaren”仅被识别为字符序列。这使得无法通过文本搜索找到“fruchtbaren”,并且在更改字体大小时,字母重叠或产生难看的间隙。

我正在使用 Linux 并寻找一个命令行工具,它允许编写所有 23 个 PDF 文档的脚本。

是否有可能以最小距离连接文本框,或者甚至连接一条线会很棒?

谢谢。

【问题讨论】:

  • 这使得无法找到“furchtbaren” - 您知道文本是“fruchtbaren”,而不是“furchtbaren”吗?
  • 大声笑......是的,你是对的,这是一个错字 - 我会更正它。但问题是关于每个字母的文本框,我想将它们组合成单词。

标签: linux pdf textbox ocr tesseract


【解决方案1】:

可能不是您想听到的,但我会返回并在一个小的代表性样本上尝试预处理、Tesseract 参数等,直到您获得尽可能好的初始 OCR(包括分词),然后使用新设置重新运行 OCR。如果您仍然发现需要某种类型的后处理,我会再次在一个小样本上构建和优化整个管道,然后再运行您的完整数据集。

从表面上看,Tesseract 似乎可以做得更好,前提是您为其提供具有足够扫描分辨率的干净图像。

【讨论】:

  • 我已经尝试使用textcleaner(滤镜、偏移和模糊)预处理图像并转换(black-thresold,白色阈值和模糊)。我使用了一个有代表性的样本,对其进行了预处理,在其上运行了 tesseract,并逐个字母地比较了文本输出。由于我只使用文本,我没有关注单词检测。但我想更好的字母检测会导致更好的单词检测......
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2015-03-12
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多