【问题标题】:Python- PDFTables parsing ignoring spaces between columnsPython-PDFTables解析忽略列之间的空格
【发布时间】:2018-04-03 05:46:47
【问题描述】:

我正在尝试使用 pdftables python 库来解析 pdf 表。但它是合并列并忽略空格。

这是我的代码:

pdf_page = get_pdf_page(fileobj, page)
tables = page_to_tables(pdf_page)

pdf文件中的表格结构:

输出:

【问题讨论】:

  • 这更像是一种变通方法而不是解决方案,但是如果您知道每个单元格的预期长度,您可以单独解析它们以修复输出表。
  • 是的,谢谢。我考虑了一下,但单元格长度从 1 到 3 不等
  • 是的,这很难。有趣的是,这个问题似乎只出现在有 100 个列的列中——即有时有更宽文本的列。理想情况下,应该可以降低 PDFMiner(PDFTables 所基于)用于确定不同单词是否在同一个框中的阈值,但我不确定这是否可行。
  • 另外,您可能需要指定您使用的 PDFTables 版本。我在 GitHub 上知道的主要有 2 个,例如:thisthis。 (您可以尝试在它们之间切换,看看其中一个是否更适合您。)
  • 最后,这是一个奇怪的想法 - 如果您手动将列分隔线添加到 PDF 中的表格,以使 PDFTables 更容易感知各个单元格,该怎么办?当然,如果您的 PDF 有很多列不工作,这是不可行的,但对于一两页来说,应该没问题。

标签: python parsing pdf pdf-parsing


【解决方案1】:

如果您意识到它是一个 % 并且您可以轻松读取 9 和 100 以下的任何数字,您可以避免一些 pdf 挫败感:读取数字直到您有 2 位(11 到 99)组合或 1 位组合(0-9 ) 或 10。如果您有 10,那么您可以在字符串的第 3 位添加 0,但不能添加除 0 之外的任何其他数字。

我用python比英语更能表达自己xD我希望这对你有帮助:

def split(str):
    number = '0'
    numbers = []
    for char in str:
        if int(char) == 0 and int(number) == 10:
            numbers.append(int(number + char))
            number = '0'
        elif int(number) > 9 and int(number) < 100 and int(char) != 0:
            numbers.append(int(number))
            number = char
        elif int(number) >= 0 and int(number) < 10:
            number = number + char
    if int(number) > 0:
        numbers.append(int(number))
    return numbers

例如,如果我使用以下代码调用:

split('25106387100')

返回

[25, 10, 63, 87, 100]

然后使用此代码,您可以将任何字符串拆分为 10 到 100 的数字,现在的问题是您是否需要拆分一位数字,在这种情况下,您可以在 0-9 条件内添加一个条件来检测是否为 'isdigit ()' 在 pdf 中具有数字位置,将 pdf 的处理减少到最小

【讨论】:

  • 备案:是“你”,不是“你”。本质上,这里的内容应该是高质量的。只是更喜欢适当、简单的语言。所有未来的读者都会欣赏这一点。
  • 感谢您的帮助,已完成。
猜你喜欢
  • 1970-01-01
  • 2022-11-24
  • 1970-01-01
  • 2011-07-06
  • 2021-05-24
  • 1970-01-01
  • 2011-02-17
  • 1970-01-01
  • 2016-05-05
相关资源
最近更新 更多