【发布时间】:2015-06-08 08:23:15
【问题描述】:
我正在尝试从 pdf e book 中提取重音单词。使用 itext 库时会产生最好的结果,但我无法从单词中获得重音。 示例:
побеђивање - 应该以- побеђи́ва̄ње(口音缺失)的形式出现
这些字母是西里尔塞尔维亚语。 我尝试了许多 ocr 解决方案,但它们都给出了不好的结果。有没有办法让我使用 itext 提取所有这些 pdf 数据,就像它们在 pdf 中一样。我知道这与 pdf 的工作方式有很大关系,而且这很难得到,但我真的需要这个,替代方法是重新输入所有数据。 pdf文件pdf example file
【问题讨论】:
-
你能发布 PDF 吗?我怀疑口音是合成的,不是角色的组成部分。
-
我将 1 个提取的 pdf 页面文件上传到问题描述中提供的链接中的位置