【问题标题】:Extract Image from PDF correctly正确从 PDF 中提取图像
【发布时间】:2021-02-19 07:38:12
【问题描述】:

我有一个 PDF 文件,其中包含成功显示该图像的图像。当我尝试使用 itextsharp 或 pdfsharp 库从 PDF 文件中提取图像时,我得到字节,然后成功解码它们(因为那里有 /Filter/FlateDecode)。但是当我尝试使用不同的库将这些字节转换为图像时,发生了异常(看起来字节实际上不是图像)。据我了解,问题在于处理这些字节,但 Pdf 中的图像没有损坏,因为它在那里正确显示。 PDF is here.

【问题讨论】:

    标签: pdf itext pdfsharp


    【解决方案1】:

    图像最有可能以 PDF 规范中记录的 PDF 图像格式存储。

    将它们转换为 Windows BMP 格式相当简单。但是您仍然必须转换它们并使用 PDF 文件中图像属性中的特定信息添加标题。
    在 PDF 中,新的图像行是字节对齐的,在 Windows BMP 中是 DWORD 对齐的。
    有的话别忘了提取颜色表。

    【讨论】:

      猜你喜欢
      • 2011-01-29
      • 2011-10-23
      • 2019-11-14
      • 2012-10-21
      • 2020-01-05
      • 2020-04-04
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多