【发布时间】:2017-03-17 14:05:03
【问题描述】:
我正在尝试使用 PyPDF2 来获取目录中每个 pdf 的页数。我可以使用 .getNumPages() 来查找一个 pdf 文件中的页数,但我需要遍历一个目录并获取每个文件的页数。有什么想法吗?
这是我目前的代码:
import pandas as pd
import os
from PyPDF2 import PdfFileReader
df = pd.DataFrame(columns=['fileName', 'fileLocation', 'pageNumber'])
pdf=PdfFileReader(open('path/to/file.pdf','rb'))
for root, dirs, files in os.walk(r'Directory path'):
for file in files:
if file.endswith(".pdf"):
df2 = pd.DataFrame([[file, os.path.join(root,file),pdf.getNumPages()]], columns=['fileName', 'fileLocation', 'pageNumber'])
df = df.append(df2, ignore_index=True)
此代码只会将目录中第一个 PDF 文件的页数添加到数据框中。如果我尝试向 PdfFilereader() 添加目录路径,我会得到一个
PermissionError:[Errno 13] Permission denied.
【问题讨论】:
-
您是否尝试过自己先做这件事?如果是这样,您应该发布您的代码,然后寻求帮助。 StackOverflow 不是让人们为您工作的地方!
-
mrpopo 我很欣赏 SO 的这一方面,但他只需要两行代码,所以也许我们可以破例:)
-
我是 StackOverflow 的新手!我编辑了我的帖子并添加了我的代码。
-
尝试用“f”替换“file”。我不认为它导致了问题,但它是一个 python 保留字。