【问题标题】:Extract text from PDF file in a Flask app在 Flask 应用程序中从 PDF 文件中提取文本
【发布时间】:2021-11-23 09:25:03
【问题描述】:

我需要从用户上传的 .pdf 文件中提取文本。从 pdf 文件中获取文本的解决方案有很多,但据我所知,在这些解决方案中,您需要将文件作为参数提供给打开文件,然后提取文本。另一方面,Flask 创建一个对象。要获得路径,我必须将其保存在目录中然后读取它,但是可能已经上传了多个文件,并且文件选择将是一个问题。使用BytesIO,您可以创建一个内存流,但是我无法找到如何从该流中提取文本的解决方案。有人可以帮我从 .pdf 文件中提取文本吗?

【问题讨论】:

    标签: python flask pdf


    【解决方案1】:

    有一个名为pymupdf 的包,我认为它可以满足您的需求。代码示例:

    import fitz
    fitz.open(stream=input_bytes, filetype="pdf")
    all_text = ""
    for page in fitz.pages():
        all_text += page.get_text("text")
    

    【讨论】:

    • 它给了AttributeError: module 'fitz' has no attribute 'pages',所以对于未来的谷歌用户,我已经编辑了我的帖子。
    猜你喜欢
    • 2011-04-30
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-12-30
    • 1970-01-01
    • 1970-01-01
    • 2014-01-25
    • 2012-03-22
    相关资源
    最近更新 更多