【问题标题】:Extracting text of Pdf on windows 8 using python 3.5.0使用 python 3.5.0 在 Windows 8 上提取 Pdf 文本
【发布时间】:2015-12-26 10:55:09
【问题描述】:

我想在 windows8 上的 slate 包的帮助下使用 python 3.5.0 从 Pdf 文件中提取文本。

问题:虽然我已经成功安装了 slate 包,但当我尝试导入 slate 时仍然存在某些错误。请指出我缺少的内容。

错误:

Traceback(最近一次调用最后一次): 文件“”,第 1 行,在 进口石板 文件“C:\Users\name\AppData\Local\Programs\Python\Python35-32\lib\site-packages\slate-0.4.1-py3.5.egg\slate__init__.py”,第 66 行,在 从 slate 导入 PDF

ImportError: 无法导入名称“PDF”

【问题讨论】:

    标签: python pdf information-retrieval slate


    【解决方案1】:

    您可以尝试poppler 库中的pdftotext (windows version)。

    作为一个独立的程序,它不需要 Python。但我经常在 Python 中将它用作子进程,如下所示:

    import subprocess
    
    args = ['pdftotext', '-layout', '-q', 'input.pdf', '-']
    txt = subprocess.check_output(args, universal_newlines=True)
    

    【讨论】:

      【解决方案2】:

      slate 依赖于 PDFMiner(不支持 Python 3。)

      您可以尝试安装它:

      pip install PDFMiner
      

      我安装了 pdfminer3k - pypi - 但它并没有很好地响应(而且文档也不好)所以我看了更多,找到了这个页面 possible alternatives。让我知道这些是否满足。

      【讨论】:

        【解决方案3】:

        你可以安装pdfminer.six

        pip install pdfminer.six
        

        https://pypi.python.org/pypi/pdfminer.six/20160614

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 2020-02-09
          • 1970-01-01
          • 1970-01-01
          • 2014-12-17
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多