【问题标题】:Extracting ToUnicode tables from PDF从 PDF 中提取 ToUnicode 表
【发布时间】:2011-10-06 22:53:05
【问题描述】:

任何人都可以提出一种易于实施的方法来从 PDF 中提取 ToUnicode 表吗?我可以使用 mupdf 中的 pdfextract 提取字体,现在我正在寻找一种方法来提取这些字体的 ToUnicode 表。

【问题讨论】:

    标签: pdf


    【解决方案1】:

    您可以修改 pdfextract 以提取 ToUnicode CMap(不是表格,CMap)。

    您可以查看 savefont 中的代码并添加如下内容:

    obj = fz_dict_gets(dict, "ToUnicode");
    if (obj)
    {
        stream = obj;
    }
    

    如果有 ToUnicode(不需要),那么您可以以与将字体流写入文件的方式类似的方式转储流。

    obj = fz_dict_gets(dict, "ToUnicode");
    if (obj)
    {
        stream = obj;
            buf = fz_new_buffer(0);
    
            error = pdf_load_stream(&buf, xref, fz_to_num(stream), fz_to_gen(stream));
            if (error)
            die(error);
                /* Do something with the data */
        }
    

    buf->data(大小为 buf->len)然后将包含 CMap,您可以将其写入文件或其他任何内容。

    【讨论】:

    • Artifex 或 MuPDF 开发人员是否会考虑将其添加/包含为 mutool extract 的“官方”功能?
    • 如果其他人想写代码,可能是的,它似乎有一些价值。开发人员目前没有时间。
    • 嘿......它只是在我看来非编码人员就像代码已经在这个答案中一样:-)
    • 缺少的部分是标记为“对数据进行操作”的注释。这当然是最难的部分.....
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-07-07
    • 2011-01-08
    • 1970-01-01
    • 2019-04-11
    相关资源
    最近更新 更多