【发布时间】:2014-07-12 18:26:09
【问题描述】:
我正在使用 apache pdfbox 框架来读取 pdf 文本内容。 我必须从“目录”页面获取内容(如果存在于 pdf 中),应该能够通过 pdfbox api 识别目录页面。 请提供您的建议。
【问题讨论】:
我正在使用 apache pdfbox 框架来读取 pdf 文本内容。 我必须从“目录”页面获取内容(如果存在于 pdf 中),应该能够通过 pdfbox api 识别目录页面。 请提供您的建议。
【问题讨论】:
PDF 文件中的目录不容易被您从 PDF 文档中提取的任何结构识别。您必须进行文本提取并通过其属性识别目录。
PDF 通常不包含内容结构,例如目录、章节、页眉、页脚,甚至是段落或文本行。
【讨论】: