【问题标题】:python pdfplumber: extract pdf with data split into 2 columnspython pdfplumber:提取pdf并将数据分成2列
【发布时间】:2020-08-25 10:58:24
【问题描述】:

我收集了一些以以下格式存储信息的 pdf 文件:

Line no 1     Line no. 11    
Line no 2     Line no. 12
.             .
.             .
.             .
Line no 10    Line no N

我正在使用pdfplumber 库来提取 PDF 的文本内容,但不是先从第 1 行读取到第 10 行,然后再向第 11 行(依此类推)pdfplumber 将第 1 行和第 11 行一起读取为单线。考虑以下输出:

Line no 1 Line no. 11    
Line no 2 Line no. 12
.             
.             
.             

我的期望:

Line no. 1
Line no. 2
.
.
.
Line no. 11
.
.
.

这是我要阅读的 pdf 文件的 link

PDF概览:

我尝试了 pdfplumber 库中的 extract_table() 实用程序和表格设置,但它不起作用(参考答案 https://stackoverflow.com/a/63133876/10011503

我是否需要将某些特定的表设置作为参数传递给pdfplumber.open('path_to_pdf').pages[0].extract_table(),或者是否有任何其他实用程序和/或解决方法?

【问题讨论】:

    标签: python python-3.x pdf


    【解决方案1】:

    我在上面的 PDF 部分中没有看到表格。我建议你使用

    Page.extract_text(...)
    

    改为打电话。

    主文档中的readme 有一个在https://github.com/jsvine/pdfplumber/blob/stable/examples/notebooks/san-jose-pd-firearm-report.ipynb 处提取固定宽度文本的示例,它更类似于您的药物PDF。

    【讨论】:

      猜你喜欢
      • 2022-12-14
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2021-12-29
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多