【问题标题】:What are some alternatives to PyPDF2 for managing PDF files? [closed]PyPDF2 有哪些替代方法来管理 PDF 文件? [关闭]
【发布时间】:2019-06-09 06:51:55
【问题描述】:

试图阅读议会的日常工作,我发现文件被分割成许多PDF文档,无法通过浏览器简单地打开阅读,必须单独下载。我的基本想法是下载所有文档并提取所有决策的标题

以前的线程建议使用 PyPDF2。显然这在我的情况下根本不起作用。 PDF 中的字符是希腊字母,因此编码可能与它有关。最重要的是,在文档的末尾,添加了一些图片(我不感兴趣)。

PyPDF2 有没有可能解决这个问题,还是我应该去别处看看?

【问题讨论】:

  • 能否提供PDF链接?
  • 您实际上想对文档做什么?你只想要文本内容吗?你关心布局/格式吗?
  • 我用 pdfminer 管理它。这里有人想出了如何将它用作库,它工作得很好。我想提取整个文本,然后剪下感兴趣的片段。
  • @Akenaten - 我强烈建议您重新考虑您在此处发帖的方式,尤其是在使用“迟钝”等术语时。把政治咆哮留在家里,而不是在这里。

标签: python python-3.x pdf pypdf2


【解决方案1】:

如果你只是在文本之后,似乎 PyPDF2 doesn't support CMaps 如果你尝试这样做,你会因此得到垃圾:

from PyPDF2 import PdfFileReader

with open('document.pdf', 'rb') as fd:
  pdf = PdfFileReader(fd)
  p1 = pdf.getPage(0)
  print(p1.extractText())

有一个开放的pull request 来解决这个问题。它没有被合并,但如果你想要它,你可以把它拉出来,因为它看起来很独立。

【讨论】:

  • 补丁已有 4 年历史。不被接受真是可惜。我怎样才能轻轻地轻推mantainers?
  • @Massimo PyPDF2 看起来有些无人维护,您可以尝试另一个分支。 PyPDF4 看起来状态更好,但仍然有些未维护。您甚至可以尝试更多recent forks 之一。向有活跃维护者的人提交更新的补丁是您最好的选择
猜你喜欢
  • 1970-01-01
  • 2023-03-28
  • 2011-02-19
  • 2010-10-12
  • 1970-01-01
  • 2011-01-13
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多