【问题标题】:How to convert Web PDF to Text如何将 Web PDF 转换为文本
【发布时间】:2022-01-26 22:19:20
【问题描述】:

我想将诸如 https://archives.nseindia.com/corporate/ICRA_26012022091856_BSER3026012022.pdf 之类的 Web PDF 转换为文本而不将它们保存到我的 PC 中,因为每天都会出现 1000 条这样的公告,因此我想将它们转换为文本而不将它们保存在我的 PC 上.对此有任何 Python 代码解决方案吗? 谢谢

【问题讨论】:

    标签: python html pdf web-scraping pdftotext


    【解决方案1】:

    有不同的方法可以做到这一点。但最简单的方法是在本地下载 PDF,然后使用以下 Python 模块之一提取文本 (OCR):

    这是一个简单的代码示例(使用 pdfplumber)

    from urllib.request import urlopen
    import pdfplumber
    url = 'https://archives.nseindia.com/corporate/ICRA_26012022091856_BSER3026012022.pdf'
    response = urlopen(url)
    file = open("img.pdf", 'wb')
    file.write(response.read())
    file.close()
    try:
        pdf = pdfplumber.open('img.pdf')
    except: 
        # Some files are not pdf, these are annexes and we don't want them. Or error reading the pdf (damaged ? )
        print(f'Error. Are you sure this is a PDF ?')
        continue
    #PDF plumber text extraction
    page = pdf.pages[0]
    text = page.extract_text()
    

    编辑:我的错,刚刚意识到你问“没有将它保存到我的电脑”。 话虽如此,我也废弃了很多(1000 多个)pdf,但都将它们保存为“img.pdf”,所以它们只是不断地相互替换,最终只有 1 个 pdf 文件。在不保存文件的情况下,我不会为 PDF OCR 提供任何解决方案。很抱歉:'(

    【讨论】:

    • 但这正是我不想做的,先生。我试过用这种方式。但这是不可行的,因为他们每天有 1000 多个这样的 PDF。因此将它们存储在 PC 中是不可行的,任何方式都可以仅在该 python 代码中完成所有操作??
    • 是的,抱歉,我理解的有点晚了。但是,如果您的问题是磁盘空间,只需使用通用名称保存它们,使它们一遍又一遍地替换就可以了。如果您的问题是时间处理,那么我把它留给其他人,并且我对答案很感兴趣,因为我试图这样做但没有成功。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-07-30
    • 2013-02-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多