【问题标题】:Itext get special letters from pdfItext从pdf中获取特殊字母
【发布时间】:2015-06-08 08:23:15
【问题描述】:

我正在尝试从 pdf e book 中提取重音单词。使用 itext 库时会产生最好的结果,但我无法从单词中获得重音。 示例:

побеђивање - 应该以- побеђи́ва̄ње(口音缺失)的形式出现

这些字母是西里尔塞尔维亚语。 我尝试了许多 ocr 解决方案,但它们都给出了不好的结果。有没有办法让我使用 itext 提取所有这些 pdf 数据,就像它们在 pdf 中一样。我知道这与 pdf 的工作方式有很大关系,而且这很难得到,但我真的需要这个,替代方法是重新输入所有数据。 pdf文件pdf example file

【问题讨论】:

  • 你能发布 PDF 吗?我怀疑口音是合成的,不是角色的组成部分。
  • 我将 1 个提取的 pdf 页面文件上传到问题描述中提供的链接中的位置

标签: java pdf itext


【解决方案1】:

示例文档实际上包含一个大图像、一个扫描页面和扫描打印字母顶部的不可见文本信息。此文本信息很可能是某些 OCR 处理的结果。

不幸的是,此文本信息已经缺少相关的重音符号。例如。第一个条目的文本

添加为

(\340\361\362\340\353\367\355)Tj 0 Tc (\236)Tj
...

如您所见,位置 1 和 4 使用了相同的字母 \340,而根据扫描的页面,其中一个匹配的打印字母有重音,一个没有。

这发生在整个页面中。

因此,任何常规文本提取的尝试都将无法返回有问题的重音符号。您唯一的机会就是使用 OCR。

你说你

尝试了许多 ocr 解决方案,但都给出了不好的结果

您可能将 OCR 应用程序应用于 PDF 或其渲染版本。我建议您改为提取扫描的图像;这样你就可以获得所有的质量。 iText 可以帮助您进行图像提取。

【讨论】:

    猜你喜欢
    • 2014-08-12
    • 1970-01-01
    • 2018-04-07
    • 2020-08-27
    • 1970-01-01
    • 1970-01-01
    • 2020-10-30
    • 2016-10-01
    • 2014-11-21
    相关资源
    最近更新 更多