【问题标题】:What's the best way to extract text from pdf in python without changing the layout and format?在不更改布局和格式的情况下,在 python 中从 pdf 中提取文本的最佳方法是什么?
【发布时间】:2019-10-14 12:45:32
【问题描述】:

我想要具有精确格式和布局的 pdf 文本。
如果 pdf to text 不是直接选择,是否可以执行 pdf -> xml -> text?
我已经尝试过 PyPDF2、pdfminer 和 pdftotxt。即使我尝试使用 AWS textract 并得到不正确的布局。
基本上,如果我可以从pdf中提取的文本中构造句子,那就足够了。
我使用了 Zamzar API,它提供了准确的输出,但它们非常昂贵。 任何可能的解决方案?

【问题讨论】:

    标签: pdf text pypdf2 pdfminer pdftotext


    【解决方案1】:

    如果您希望保留 PDF 的结构而不是字体、颜色、大小等,请尝试使用 pdftables_api 库。这应该包含您的 PDF 的布局。将 PDF 转换为 CSV,因为 CSV 文件只是一个逗号分隔的文本文件。

    如果您希望保留字体、颜色等,Zamzar API 可能是您的最佳选择。

    【讨论】:

      猜你喜欢
      • 2019-12-04
      • 2021-04-05
      • 2020-01-16
      • 2014-09-20
      • 2016-09-17
      • 2021-11-28
      • 1970-01-01
      • 2020-02-20
      • 2015-07-16
      相关资源
      最近更新 更多