【发布时间】:2020-05-10 16:07:07
【问题描述】:
需要解析一个 PDF 文件以便只提取文本的前几行,并寻找不同的 Python 包来完成这项工作,但没有任何运气。
试过了:
PDFminer、PDFminer.six 和 PDFminer3k,对于简单的工作来说似乎过于复杂,我找不到简单的工作示例
slate,在安装中得到了error,虽然可以从线程修复,但尝试时出错;可能使用了错误的 PDFminer,但不知道该使用哪个
tika,它给出了不同的终端错误消息并且非常慢
pdftotext 安装失败
pdf2text 在“导入 pdf2text”时失败,当更改为“pdftotext”时无法导入“ImportError: cannot import name 'Extractor'”,即使
pip list显示已安装“Extractor”
通常我发现已安装的 Python 包运行良好,但将 PDF 解析为文本似乎是一个丛林,无数工具也表明了这一点。
关于如何在 Python 中将 PDF 文件简单解析为文本有什么建议吗?
添加了 PyPDF2 示例
PyPDF2 的一个例子是:
import PyPDF2
pdfFileObj = open('file.pdf', 'rb')
pdfReader = PyPDF2.PdfFileReader(pdfFileObj)
pageObj_0 = pdfReader.getPage(0)
print(pageObj_0.extractText())
返回垃圾为:
$%$%&%&$'('~!)"*+#
【问题讨论】:
-
请不要关闭这个问题...我只是寻找一些有效的 Python 代码...如果 SO 不是为了那个,那它有什么用?
标签: python python-3.x pdf text