【发布时间】:2019-11-20 04:18:40
【问题描述】:
我尝试阅读带有文本表格数据的 PDF 文件并成功了。但是我有一个 PDF 格式的图像,其中包含一些需要提取以用于记录目的的文本。所有的 PDF 都在一个特定的文件夹中。我只知道python的基础知识。 谁能帮我解决这个问题?
【问题讨论】:
-
这是重复的。看看这篇文章:stackoverflow.com/questions/17630650/…
-
tabula.technology 这可能会使用您正在提取的特定字段的坐标来解决您的问题
-
我尝试过使用 pyPDF2 。它可以识别 pdf 中的表格数据和文本,这些数据和文本从 MS word 转换为 PDF,但我需要读取包含一些随机文本的图像。有人可以帮忙吗?
标签: python