【问题标题】:using "PDFBox" how to identify "Table of contents" page使用“PDFBox”如何识别“目录”页面
【发布时间】:2014-07-12 18:26:09
【问题描述】:

我正在使用 apache pdfbox 框架来读取 pdf 文本内容。 我必须从“目录”页面获取内容(如果存在于 pdf 中),应该能够通过 pdfbox api 识别目录页面。 请提供您的建议。

【问题讨论】:

    标签: pdf pdfbox


    【解决方案1】:

    PDF 文件中的目录不容易被您从 PDF 文档中提取的任何结构识别。您必须进行文本提取并通过其属性识别目录。

    PDF 通常不包含内容结构,例如目录、章节、页眉、页脚,甚至是段落或文本行。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2021-10-05
      • 1970-01-01
      • 1970-01-01
      • 2015-09-02
      • 1970-01-01
      • 2013-07-15
      • 2015-02-01
      相关资源
      最近更新 更多