【发布时间】:2019-01-02 16:31:23
【问题描述】:
我正在尝试将 PDF 转换为 Python 中的文本。但它给了我一个错误:
PDFTextExtractionNotAllowed:不允许提取文本:<_io.bufferedreader name="C:\Users\Downloads\Facts_for_2017.pdf">
我使用的代码是:
import sys
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.pdfpage import PDFPage
from pdfminer.converter import XMLConverter, HTMLConverter, TextConverter
from pdfminer.layout import LAParams
import io
def pdfparser(data):
fp = open(data, 'rb')
rsrcmgr = PDFResourceManager()
retstr = io.StringIO()
codec = 'utf-8'
laparams = LAParams()
device = TextConverter(rsrcmgr, retstr, codec=codec, laparams=laparams)
interpreter = PDFPageInterpreter(rsrcmgr, device)
for page in PDFPage.get_pages(fp):
interpreter.process_page(page)
data = retstr.getvalue()
return data
if __name__ == '__main__':
text = pdfparser(Input_path)
谁能帮帮我?
文件路径是:
https://drive.google.com/file/d/1RyR-J-EwMywL6BqsYbl4Ocm96VzCYrM7/view?usp=sharing
【问题讨论】:
-
小心,你没有关闭你的fp
-
谢谢,但还是不行。
-
可能与此问题相同,其中 PDF 被标记为不允许提取:stackoverflow.com/questions/39981980/…
标签: python python-3.x pdfminer