【发布时间】:2018-11-24 07:09:04
【问题描述】:
我有数千个 PDF 文件,例如 this one。
我正在尝试使用 PyPDF2 将它们转换为纯文本(代码如下)。但 PyPDF2 显然只“看到”水印,而不是内容本身。我可以在这里做什么?
import os
import PyPDF2
path_to_pdfs = '/path/to/pdf/files/'
for filename in os.listdir(path_to_pdfs):
if '.pdf' in filename.lower():
with open(path_to_pdfs + filename, mode = 'rb') as f:
txt = ''
pdf_reader = PyPDF2.PdfFileReader(f)
num_pages = pdf_reader.numPages
for page in range(num_pages):
page_obj = pdf_reader.getPage(page)
page_text = page_obj.extractText()
txt = txt + '\n' + page_text
print(txt)
我在 macOS 10.13.14 上使用 Python 3.5.1 和 PyPDF2 1.26.0。
【问题讨论】: