【发布时间】:2020-11-05 15:16:17
【问题描述】:
我正在尝试从 PDF 中获取目录。我为此目的使用 PyMuPDF。但仅当 PDF 包含书签时,它才会提取 ToC。否则它只会导致一个空列表。
def get_Table_Of_Contents(doc):
toc = doc.getToC()
return toc
toc= get_Table_Of_Contents(file)
toc
【问题讨论】:
-
我也面临同样的情况。如果 PDF 不包含书签,您是否找到任何提取 ToC 的方法
标签: python pdf text nlp pymupdf