【发布时间】:2015-10-22 00:29:03
【问题描述】:
我已经阅读了有关此问题的其他堆栈溢出问题,但它没有回答我的问题,因此请投反对票。它的版本 2.7。
我想要做的就是使用 python 将 PDF 转换为 Word 文档。至少转换为文本,以便我可以复制并粘贴到 word 文档中。
这是我到目前为止的代码。它打印的只是女性性别符号。
我的代码错了吗?我接近这个错误吗?某些 PDF 文件不能与 PDFMiner 一起使用吗?除了使用 PyPDF2 或 PDFMiner 之外,您是否知道实现我将 PDF 转换为 Word 的目标的任何其他替代方法?
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from pdfminer.pdfpage import PDFPage
from cStringIO import StringIO
def convert_pdf_to_txt(path):
rsrcmgr = PDFResourceManager()
retstr = StringIO()
codec = 'utf-8'
laparams = LAParams()
device = TextConverter(rsrcmgr, retstr, codec=codec, laparams=laparams)
fp = file('Bottom Dec.pdf', 'rb')
interpreter = PDFPageInterpreter(rsrcmgr, device)
password = ""
maxpages = 0
caching = True
pagenos=set()
for page in PDFPage.get_pages(fp, pagenos, maxpages=maxpages, password=password,caching=caching, check_extractable=True):
interpreter.process_page(page)
text = retstr.getvalue()
fp.close()
device.close()
retstr.close()
return text
print convert_pdf_to_txt(1)
【问题讨论】:
-
你安装了 LibreOffice 吗?如果是这样,请阅读此答案stackoverflow.com/a/26358582/797495
-
唉,我没有。只是普通的旧 MS Word;并在那个时候过时了...... 2003。它是我的工作,而不是我。不过我确实看到了。
-
"某些 PDF 文件不能与 PDFMiner 一起使用吗?"是的。 '一个总是可以从每个 PDF中正确提取所有文本'不是事实。请发布一个指向您遇到问题的 PDF 的链接,以便我们确定问题出在您的代码、PDFMiner 中,还是根本不包含任何可提取的文本。
标签: python-2.7 pdf ms-word