【问题标题】:PyPDF2 File reader returns data without spacesPyPDF2 文件阅读器返回不带空格的数据
【发布时间】:2017-12-26 15:39:38
【问题描述】:

当我尝试使用下面的代码读取包含表格数据的 pdf 文件时,两列或两行之间没有空格。

import PyPDF2 
pdfFileObj = open('filename.pdf', 'rb',)
pdfReader = PyPDF2.PdfFileReader(pdfFileObj)
pdfReader.numPages
pageObj = pdfReader.getPage(0)
pageObj.extractText()

输出是这样的

'Page 1 of 1MINISTRY OF CORPORATE AFFAIRSRECEIPTG.A.R.7SRN :U16571275Payment 
made into :Service Request Date :03/08/2017Received From :'

1 之后、A.R.7 之后以及“U16571275”和“Payment”之间的空格

【问题讨论】:

  • 这个问题似乎与this 的答案重复。我遇到了同样的缺少空格的问题,它帮助我解决了我的问题

标签: python parsing pdf pypdf2


【解决方案1】:
extractText() 

方法返回页面文本的字符串,有时文本提取可能不完美。

如果您尝试在 python 中读取 PDF 文件,您也可以尝试使用 Textract 模块作为替代。 http://textract.readthedocs.io/en/stable/index.html.

pip install textract

安装后

import textract
text = textract.process('path/to/pdf/file', method='pdfminer')

【讨论】:

    猜你喜欢
    • 2018-01-04
    • 1970-01-01
    • 1970-01-01
    • 2018-03-08
    • 1970-01-01
    • 2011-09-21
    • 2021-05-21
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多