【问题标题】:How to read a TEXT in an image in PDF extension file using Python?如何使用 Python 读取 PDF 扩展文件中的图像中的文本?
【发布时间】:2019-11-20 04:18:40
【问题描述】:

我尝试阅读带有文本表格数据的 PDF 文件并成功了。但是我有一个 PDF 格式的图像,其中包含一些需要提取以用于记录目的的文本。所有的 PDF 都在一个特定的文件夹中。我只知道python的基础知识。 谁能帮我解决这个问题?

【问题讨论】:

标签: python


【解决方案1】:

您可以使用pdfreader从 PDF 文档中提取图像(内联和 XObject)和文本(纯文本和包含 PDF 运算符)

这是从所有文档页面中提取上述所有内容的示例代码。

from pdfreader import SimplePDFViewer, PageDoesNotExist

fd = open(you_pdf_file_name, "rb")
viewer = SimplePDFViewer(fd)

plain_text = ""
pdf_markdown = ""
images = []
try:
    while True:
        viewer.render()
        pdf_markdown += viewer.canvas.text_content
        plain_text += "".join(viewer.canvas.strings)
        images.extend(viewer.canvas.inline_images)
        images.extend(viewer.canvas.images.values())
        viewer.next()
except PageDoesNotExist:
    pass

您也可以将图片转换为PIL/Pillow对象并保存

for i, img in enumerate(images):
    img.to_Pillow().save("{}.png".format(i))

【讨论】:

    猜你喜欢
    • 2020-05-10
    • 1970-01-01
    • 2016-04-06
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-05-05
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多