【发布时间】:2012-06-26 12:59:38
【问题描述】:
我在可用命令行的帮助下将 PDF 拆分为页面:
for G in $(seq 1 $(pdfinfo 47.pdf | sed -n 's/Pages:[^0-9]*\([0-9]*\).*/\1/p')) ; do
gs \
-dSAFER \
-sDEVICE=pdfwrite \
-dBATCH \
-dNOPAUSE \
-dFirstPage=$G \
-dLastPage=$G \
-o $G.pdf \
47.pdf ;
done
但有些页面显示没有文字(图形仍然存在)
所以,我尝试从 PDF 中提取嵌入字体:
gs -q -dNODISPLAY extractFonts.ps -c "(47.pdf) extractFonts quit"
这些字体我已安装在系统字体文件夹中。
之后,我重复拆分,没有发生任何变化。
如何确保正确提取页面,我现在不知道。
【问题讨论】:
-
从 PDF 中提取字体以按照您的方式重新使用它们通常不会像您预期的那样工作。大多数 PDF 嵌入字体是仅子集(不是包含所有字形的完整字体),并且在提取后它们将具有不同的名称(通常在原始名称的基础上加上 6 个字母的前缀),并且他们也会有非标准的编码......所有这些都使得无法以可靠的方式重新使用提取的字体尸体。
标签: pdf ghostscript