【发布时间】:2020-05-05 18:45:57
【问题描述】:
我在 Android Studio 库中使用这个 https://github.com/TomRoush/PdfBox-Android PDFBox 从 PDF 文档中提取文本。这就是我正在做的事情:
File pdf_file = new File(file_path);
创建文件,然后
PDDocument document = null;
document = PDDocument.load(pdf_file);
将文件加载到 PDDocument 对象中,然后
PDFTextStripper pdfStripper = new PDFTextStripper();
pdfStripper.setStartPage(...);
pdfStripper.setEndPage(...);
String page_text = pdfStripper.getText(document);
获取页面的文本内容。问题是当有例如“公司”这个词时,它会显示为“公司”。它基本上在 fi 之后放置一个空格(我猜是 fls 和其他连字)。我尝试阅读此Problems with extracting OpenTypeFont text using pdfBox,但我不明白如何解决它。没有解决方案详情。
重要提示:事实证明,在我的 PDF 文件中,我没有任何连字,例如 fi,但我有常规 fi,但它后面还有空格。解决方案尚不清楚。
PDF 文件:https://wetransfer.com/downloads/09e9036dda4a7962ccad32b1cbcd8edc20200506050349/ab4752
【问题讨论】:
-
请分享文件。我想知道桌面版 PDFBox 是否会发生这种情况。
-
@TilmanHausherr 你好,我已经更新了我的问题,提供了下载 PDF 的链接
-
我也遇到过这个问题,我通过搜索 fi AND fi(连字)解决了这个问题
-
@Lonzak 嗯,你是怎么解决的?您找到连字 fi 并删除它后面的空格?
-
@JingleBells 查看我发布的答案...
标签: java android-studio pdfbox text-extraction