【发布时间】:2019-07-17 15:48:28
【问题描述】:
我正在尝试将 pdf 文件中的文本转换为文本或 HTML 格式,但此错误经常发生 '无法从'pdfminer.pdfinterp'导入名称'process_pdf' ' 我怎样才能删除它?
我在visual basic studio中试过这段代码,但还是不行,但在那种情况下,我因为空格而出现缩进错误,所以我在jupyter notebook中尝试了这个,得到了这个错误。
from io import StringIO
from pdfminer.pdfinterp import PDFResourceManager , process_pdf
from pdfminer.converter import TextConverter
from pdfminer.layput import LAParams
def to_txt(pdf_path):
input_ = file(pdf_path , 'rb')
output = StringIO()
manager = PDFResourceManager()
converter = TextConverter(manager, output, laparams = LAParams())
process_pdf(manager, converter, input_)
return output.getvalue()
b = to_txt(rb"C:\Users\Jasvinder Singh\Desktop\HACK-IN REPORT.docx")
ImportError: cannot import name 'process_pdf' from 'pdfminer.pdfinterp' (C:\Users\Jasvinder Singh\Anaconda3\lib\site-packages\pdfminer\pdfinterp.py)
【问题讨论】:
-
欢迎来到 SO!为什么你认为
process_pdf是pdfminer.pdfinterp中的一个方法? -
@vekerdyb 当我开始使用这个新领域时,我在这里搜索堆栈溢出的代码,但它显示的代码超过 12 个月或更早,所以我选择使用它。另外,我正在搜索它的文档,但找不到合适的站点。感谢您的帮助。
标签: python python-3.x jupyter-notebook pdfminer pdf-to-html