【问题标题】:How to fix 'cannot import name 'process_pdf' from 'pdfminer.pdfinterp'' error如何修复“无法从'pdfminer.pdfinterp'导入名称'process_pdf'”错误
【发布时间】:2019-07-17 15:48:28
【问题描述】:

我正在尝试将 pdf 文件中的文本转换为文本或 HTML 格式,但此错误经常发生 '无法从'pdfminer.pdfinterp'导入名称'process_pdf' ' 我怎样才能删除它?

我在visual basic studio中试过这段代码,但还是不行,但在那种情况下,我因为空格而出现缩进错误,所以我在jupyter notebook中尝试了这个,得到了这个错误。

from io import StringIO
from pdfminer.pdfinterp import PDFResourceManager , process_pdf
from pdfminer.converter import TextConverter
from pdfminer.layput import LAParams



def to_txt(pdf_path):
    input_ = file(pdf_path , 'rb')
    output = StringIO()

    manager = PDFResourceManager()
    converter = TextConverter(manager, output, laparams = LAParams())
    process_pdf(manager, converter, input_)

    return output.getvalue()

b = to_txt(rb"C:\Users\Jasvinder Singh\Desktop\HACK-IN REPORT.docx")

ImportError: cannot import name 'process_pdf' from 'pdfminer.pdfinterp' (C:\Users\Jasvinder Singh\Anaconda3\lib\site-packages\pdfminer\pdfinterp.py)

【问题讨论】:

  • 欢迎来到 SO!为什么你认为process_pdfpdfminer.pdfinterp 中的一个方法?
  • @vekerdyb 当我开始使用这个新领域时,我在这里搜索堆栈溢出的代码,但它显示的代码超过 12 个月或更早,所以我选择使用它。另外,我正在搜索它的文档,但找不到合适的站点。感谢您的帮助。

标签: python python-3.x jupyter-notebook pdfminer pdf-to-html


【解决方案1】:

请参阅documentationthis comment on a bug

process_pdf 方法已被 PDFPage.get_pages() 替换。

【讨论】:

    猜你喜欢
    • 2021-09-27
    • 2019-11-02
    • 2019-12-30
    • 1970-01-01
    • 2018-02-14
    • 2019-11-27
    • 2015-02-05
    • 2019-12-19
    • 1970-01-01
    相关资源
    最近更新 更多