【问题标题】:Extracting text from PDF : PDFLib vs PDF extract vs pdf2xml [closed]从 PDF 中提取文本:PDFLib vs PDF extract vs pdf2xml [关闭]
【发布时间】:2010-09-21 10:22:35
【问题描述】:
我正在寻找一个库(如果可能在 Java 或 PHP 中可用)以便从 PDF 中提取文本。有很多可用的软件,包括:
您会选择哪些工具?你觉得他们怎么样?
非常感谢您的热心帮助!
【问题讨论】:
标签:
java
php
pdf
text-extraction
【解决方案1】:
我最喜欢的是 iText (java),但从 PDF 中提取文本可能会遇到很多困难,因为 PDF 中的文本并不总是按其出现的顺序存储。
【解决方案2】:
itext 无法从 irs i1040.pdf 正确提取文本
如此处报道:
article.gmane.org/gmane.comp.java.lib.itext.general/65680
据我所知,当字体嵌入时,
提取正确的文本并不总是可能的。
看:
www.verypdf.com/wordpress/201109/pdf-to-text-converter-cant-extract-text-which-render-by-embedded-fonts-2452.html
第 9.10.1 节:
www.adobe.com/content/dam/Adobe/en/devnet/pdf/pdfs/PDF32000_2008.pdf
说:
如果字体不是以其中一种方式定义的...字符
如果没有附加信息,则无法转换为 Unicode 值。
我认为“转换为 unicode 值”对于文本提取至关重要。