【问题标题】:How can I extract raw text from PDFs using Apache POI?如何使用 Apache POI 从 PDF 中提取原始文本?
【发布时间】:2013-05-30 10:18:56
【问题描述】:

我需要从几个文件中提取原始文本,其中一些是 PDF 文件格式,一些是 DOC 文件格式。

我必须使用 Apache POI 来执行此操作。现在,我找到了很多关于处理 word 文件(提取和写入等)的文档,但我找不到任何关于从 PDF 中提取的文档。

我认为 Apache POI 具有此功能是错误的吗?

如果是这样,谁能推荐类似的允许从多种文件格式中提取文本的 Java 程序?

如果没有,谁能指出我应该查看的文档和/或类/方法?

提前感谢您的帮助。

【问题讨论】:

    标签: java pdf apache-poi text-extraction


    【解决方案1】:

    是的,您认为 POI 会这样做是错误的。 Apache POI 适用于 Microsoft Office 文件格式,而 PDF 不适用。

    您可以直接使用Apache PDFBox,也可以使用我们的Apache Tika,它可以处理Microsoft Office 和PDF 文件格式(以及许多其他格式)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-07-11
      • 1970-01-01
      • 1970-01-01
      • 2022-09-24
      • 2011-06-06
      • 1970-01-01
      • 2011-07-24
      • 1970-01-01
      相关资源
      最近更新 更多