【问题标题】:Extracting text of Pdf on windows 8 using python 3.5.0使用 python 3.5.0 在 Windows 8 上提取 Pdf 文本
【发布时间】:2015-12-26 10:55:09
【问题描述】:
我想在 windows8 上的 slate 包的帮助下使用 python 3.5.0 从 Pdf 文件中提取文本。
问题:虽然我已经成功安装了 slate 包,但当我尝试导入 slate 时仍然存在某些错误。请指出我缺少的内容。
错误:
Traceback(最近一次调用最后一次):
文件“”,第 1 行,在
进口石板
文件“C:\Users\name\AppData\Local\Programs\Python\Python35-32\lib\site-packages\slate-0.4.1-py3.5.egg\slate__init__.py”,第 66 行,在
从 slate 导入 PDF
ImportError: 无法导入名称“PDF”
【问题讨论】:
标签:
python
pdf
information-retrieval
slate
【解决方案1】:
您可以尝试poppler 库中的pdftotext (windows version)。
作为一个独立的程序,它不需要 Python。但我经常在 Python 中将它用作子进程,如下所示:
import subprocess
args = ['pdftotext', '-layout', '-q', 'input.pdf', '-']
txt = subprocess.check_output(args, universal_newlines=True)
【解决方案2】:
slate 依赖于 PDFMiner(不支持 Python 3。)
您可以尝试安装它:
pip install PDFMiner
我安装了 pdfminer3k - pypi - 但它并没有很好地响应(而且文档也不好)所以我看了更多,找到了这个页面 possible alternatives。让我知道这些是否满足。