【问题标题】:Extracting text from PDF : PDFLib vs PDF extract vs pdf2xml [closed]从 PDF 中提取文本:PDFLib vs PDF extract vs pdf2xml [关闭]
【发布时间】:2010-09-21 10:22:35
【问题描述】:

我正在寻找一个库(如果可能在 Java 或 PHP 中可用)以便从 PDF 中提取文本。有很多可用的软件,包括:

您会选择哪些工具?你觉得他们怎么样?

非常感谢您的热心帮助!

【问题讨论】:

    标签: java php pdf text-extraction


    【解决方案1】:

    我最喜欢的是 iText (java),但从 PDF 中提取文本可能会遇到很多困难,因为 PDF 中的文本并不总是按其出现的顺序存储。

    【讨论】:

      【解决方案2】:

      itext 无法从 irs i1040.pdf 正确提取文本 如此处报道:

      article.gmane.org/gmane.comp.java.lib.itext.general/65680

      据我所知,当字体嵌入时, 提取正确的文本并不总是可能的。 看: www.verypdf.com/wordpress/201109/pdf-to-text-converter-cant-extract-text-which-render-by-embedded-fonts-2452.html 第 9.10.1 节: www.adobe.com/content/dam/Adobe/en/devnet/pdf/pdfs/PDF32000_2008.pdf

      说:

      如果字体不是以其中一种方式定义的...字符 如果没有附加信息,则无法转换为 Unicode 值。

      我认为“转换为 unicode 值”对于文本提取至关重要。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2012-08-24
        • 2020-12-11
        • 2011-01-08
        • 2011-10-23
        • 1970-01-01
        • 1970-01-01
        • 2018-02-20
        相关资源
        最近更新 更多