【发布时间】:2016-05-26 02:47:37
【问题描述】:
在我的一项 NLP 作业中,我必须阅读 PDF 文件并从中提取信息。使用 Java,我能够从 PDF 中读取文本内容,并能够在文本上应用我们的 NLP 算法,但我还需要提取 PDF 中的表格中存在的信息,我正在尝试阅读它们但无法正确获取它们格式。知道如何从 PDF 文档中读取表格,或者任何提示是否在 OpenNLP、GATE、Stanford NLP 中提供任何库来实现这些。
【问题讨论】:
在我的一项 NLP 作业中,我必须阅读 PDF 文件并从中提取信息。使用 Java,我能够从 PDF 中读取文本内容,并能够在文本上应用我们的 NLP 算法,但我还需要提取 PDF 中的表格中存在的信息,我正在尝试阅读它们但无法正确获取它们格式。知道如何从 PDF 文档中读取表格,或者任何提示是否在 OpenNLP、GATE、Stanford NLP 中提供任何库来实现这些。
【问题讨论】:
不幸的是,表格作为结构并不存储在 PDF 中。您必须应用一些严肃的坐标数学来确定/估计表格的位置、列的位置和行的位置。
对于 PDF,Apache Tika 没有任何特殊的表格处理(它适用于 MSWord、MSPPT 和许多其他格式,但不是 PDF)。
要将表格从 PDF 中提取为表格,您可以考虑使用tabulapdf;另请参阅 John Hewson 的 recommendation。还有一些商业工具可能在从 PDF 中提取表格方面做得不错—— Abby Finereader、Nuance *PDF 产品。
【讨论】: