【问题标题】:Extracting particular data using pdftotext使用 pdftotext 提取特定数据
【发布时间】:2021-11-05 01:31:27
【问题描述】:

我正在使用 pdftotext Python 库从 PDF 文档中提取一些数据。

import pdftotext

# Load your PDF
with open("text2.pdf", "rb") as f:
    pdf = pdftotext.PDF(f)


# How many pages?
print(len(pdf))



data = "\n\n".join(pdf)
# Read all the text into one string
print(data)

提取的数据为:

Account Name               :Mr. SX
Account Name               :Mr. XX XX XX
Address                  : Address detaisls
                      
Date                        :7 Sep 2021
Account Number               :00000031873583221
Account Description          :REGULAR SB CHQ-INDIVIDUALS
Branch                      :SSI 
Drawing Power               :0.00

整个数据都是字符串,但我只想提取帐号。 我使用了正则表达式:

^(Account\s+Number).*$

但无法弄清楚如何从整个字符串中提取数据。

【问题讨论】:

    标签: python text data-extraction pdftotext


    【解决方案1】:

    你可以试试:

    >>> '\n'.join([re.sub(r'Account Number\s+:', '', line) for line in data.splitlines() if 'Account Number' in line])
    '00000031873583221'
    >>> 
    

    没有正则表达式更容易:

    >>> '\n'.join([line.split(':')[-1] for line in data.splitlines() if 'Account Number' in line])
    '00000031873583221'
    >>> 
    

    【讨论】:

      猜你喜欢
      • 2023-03-25
      • 1970-01-01
      • 2020-07-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-02-04
      • 2018-08-29
      • 2017-09-12
      相关资源
      最近更新 更多