【发布时间】:2011-10-06 22:53:05
【问题描述】:
任何人都可以提出一种易于实施的方法来从 PDF 中提取 ToUnicode 表吗?我可以使用 mupdf 中的 pdfextract 提取字体,现在我正在寻找一种方法来提取这些字体的 ToUnicode 表。
【问题讨论】:
标签: pdf
任何人都可以提出一种易于实施的方法来从 PDF 中提取 ToUnicode 表吗?我可以使用 mupdf 中的 pdfextract 提取字体,现在我正在寻找一种方法来提取这些字体的 ToUnicode 表。
【问题讨论】:
标签: pdf
您可以修改 pdfextract 以提取 ToUnicode CMap(不是表格,CMap)。
您可以查看 savefont 中的代码并添加如下内容:
obj = fz_dict_gets(dict, "ToUnicode");
if (obj)
{
stream = obj;
}
如果有 ToUnicode(不需要),那么您可以以与将字体流写入文件的方式类似的方式转储流。
obj = fz_dict_gets(dict, "ToUnicode");
if (obj)
{
stream = obj;
buf = fz_new_buffer(0);
error = pdf_load_stream(&buf, xref, fz_to_num(stream), fz_to_gen(stream));
if (error)
die(error);
/* Do something with the data */
}
buf->data(大小为 buf->len)然后将包含 CMap,您可以将其写入文件或其他任何内容。
【讨论】:
mutool extract 的“官方”功能?