【发布时间】:2013-05-10 08:30:31
【问题描述】:
如何判断一个PDF页面是包含文字还是纯图片,使用Java?
我搜索了很多论坛和网站,但我还没有找到答案。
是否可以从PDF中提取文本,知道页面是图片格式还是文本格式?
PdfReader reader = new PdfReader(INPUTFILE);
PrintWriter out = new PrintWriter(new FileOutputStream(OUTPUTFILE));
for (int i = 1; i <= reader.getNumberOfPages(); i++) {
// here I want to test the structure of the page !!!! if it's possible
out.println(PdfTextExtractor.getTextFromPage(reader, i));
}
【问题讨论】:
-
这似乎很复杂。也许你在这里需要赏金
-
谢谢阿德尔先生,希望如此:)