【发布时间】:2019-10-14 12:45:32
【问题描述】:
我想要具有精确格式和布局的 pdf 文本。
如果 pdf to text 不是直接选择,是否可以执行 pdf -> xml -> text?
我已经尝试过 PyPDF2、pdfminer 和 pdftotxt。即使我尝试使用 AWS textract 并得到不正确的布局。
基本上,如果我可以从pdf中提取的文本中构造句子,那就足够了。
我使用了 Zamzar API,它提供了准确的输出,但它们非常昂贵。
任何可能的解决方案?
【问题讨论】:
标签: pdf text pypdf2 pdfminer pdftotext