【发布时间】:2016-05-05 07:13:43
【问题描述】:
我有一个 PDF 文件,其中包含可以分布在各个页面上的表格,并且中间可能有文本。可以在here 找到它的一个示例。 我能够将 PDF 转换为任何格式,但输出文件不能以任何方式解析,即我无法从中提取数据,因为它们是分散的。以下是我使用pdftotext 和pdftohtml 创建的输出文件的链接。
有没有办法以更合适的方式提取数据? 提前致谢。
【问题讨论】:
-
您的示例文件似乎有正确标记的数据。它在这方面代表您的所有文件吗?
-
是的,我所有的文件几乎都采用相同的格式。你能告诉我它是如何正确标记的吗?这正是我提取表格所需要的。
-
您能告诉我它是如何正确标记的吗? - 创建 PDF 时,您可以选择在其中插入机器可解析的标签来表示内容的结构。您的示例文件确实有这些标签。不幸的是,我不知道哪些 python 工具可以正确解释这些标签。我想知道如何在 Java 中提取数据。