【发布时间】:2018-04-03 05:46:47
【问题描述】:
我正在尝试使用 pdftables python 库来解析 pdf 表。但它是合并列并忽略空格。
这是我的代码:
pdf_page = get_pdf_page(fileobj, page)
tables = page_to_tables(pdf_page)
【问题讨论】:
-
这更像是一种变通方法而不是解决方案,但是如果您知道每个单元格的预期长度,您可以单独解析它们以修复输出表。
-
是的,谢谢。我考虑了一下,但单元格长度从 1 到 3 不等
-
是的,这很难。有趣的是,这个问题似乎只出现在有 100 个列的列中——即有时有更宽文本的列。理想情况下,应该可以降低 PDFMiner(PDFTables 所基于)用于确定不同单词是否在同一个框中的阈值,但我不确定这是否可行。
-
最后,这是一个奇怪的想法 - 如果您手动将列分隔线添加到 PDF 中的表格,以使 PDFTables 更容易感知各个单元格,该怎么办?当然,如果您的 PDF 有很多列不工作,这是不可行的,但对于一两页来说,应该没问题。
标签: python parsing pdf pdf-parsing