【问题标题】:extracting data into columns using pdfplumber使用 pdfplumber 将数据提取到列中
【发布时间】:2022-12-14 17:30:30
【问题描述】:

我有一个 pdf,它有表格格式的数据,有 6 列,但列没有被边界分隔,所以当我使用 pdfplumber 提取数据时,所有数据只出现在一个单元格中,我想要在单独的单元格中。

我怎么能那样做?

供你参考:

15/03/2021 RTGS-UTIBR52021031300662458-VIRENDER KUMAR 2,60,635.00 2,94,873.94Cr 11/03/2021 IMPS/P2A/107018040382/XXXXXXXXXX0980/trf 49,500.00 34,238.94Cr 11/03/2021 IMPS/P2A/107018771795/KINGDOMHOTELAND/trf 35,000.00 83,738.94Cr

提前致谢

【问题讨论】:

    标签: pandas tabula tabula-py pdfplumber


    【解决方案1】:

    您可以使用 extract_tables() 方法将表放入数据框中。

    在这里我可以只提到第 0 页的代码。使用 for 循环从所有页面中提取表格。

    import pdfplumber
    path = file_path
    
    pdf = pdfplumber.open(path,password="")
    table = pd.DataFrame(pdf.pages[0].extract_tables())
    

    根据您的要求更改代码。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-02-04
      • 1970-01-01
      • 2021-10-06
      • 2019-12-14
      • 1970-01-01
      相关资源
      最近更新 更多