【问题标题】:Reading tables and images from PDF using any NLP tools [closed]使用任何 NLP 工具从 PDF 中读取表格和图像 [关闭]
【发布时间】:2016-05-26 02:47:37
【问题描述】:

在我的一项 NLP 作业中,我必须阅读 PDF 文件并从中提取信息。使用 Java,我能够从 PDF 中读取文本内容,并能够在文本上应用我们的 NLP 算法,但我还需要提取 PDF 中的表格中存在的信息,我正在尝试阅读它们但无法正确获取它们格式。知道如何从 PDF 文档中读取表格,或者任何提示是否在 OpenNLP、GATE、Stanford NLP 中提供任何库来实现这些。

【问题讨论】:

    标签: java pdf nlp opennlp


    【解决方案1】:

    不幸的是,表格作为结构并不存储在 PDF 中。您必须应用一些严肃的坐标数学来确定/估计表格的位置、列的位置和行的位置。

    对于 PDF,Apache Tika 没有任何特殊的表格处理(它适用于 MSWord、MSPPT 和许多其他格式,但不是 PDF)。

    要将表格从 PDF 中提取为表格,您可以考虑使用tabulapdf;另请参阅 John Hewson 的 recommendation。还有一些商业工具可能在从 PDF 中提取表格方面做得不错—— Abby Finereader、Nuance *PDF 产品。

    【讨论】:

    • 感谢 cmets,我已经开始评估 tabulapdf,tweeking 一些代码,能够获取表格内容,但不是全部。完成后会更新。
    猜你喜欢
    • 1970-01-01
    • 2018-07-07
    • 2010-12-05
    • 1970-01-01
    • 1970-01-01
    • 2016-01-23
    • 2013-03-18
    • 2010-10-28
    • 2010-12-09
    相关资源
    最近更新 更多