【发布时间】:2018-07-31 10:10:49
【问题描述】:
我有一个 pdf 文件无法通过 pdfbox 或 itext7 提取文本。字体由 Identity-H 和 Adobe-Identity-UCS 编码。下面给出 ToUnicode 的详细信息。
/CIDInit /ProcSet findresource 开始 12 字典开始 开始地图 /CIDSystemInfo > 定义 /CMapName /Adobe-Identity-UCS def /CMapType 2 定义 1 开始代码空间范围ToUnicode 无效。有什么办法可以解决吗?
我尝试下载完整的 Adobe-Identity-UCS cmap 文件并替换它。但是经过大量谷歌搜索,我找不到 Adobe-Identity-UCS cmap 文件。
有什么帮助吗?谢谢。
编辑:
【问题讨论】:
-
@TilmanHausherr。谢谢。我知道重写 ToUnicode 的方法,但是找不到 Adobe-Identity-UCS cmap。
-
@KlSoft 你能贴一个PDF文件的下载链接吗?
-
@MihaiIancu 当然。谢谢。
-
@KlSoft 我认为文件可能使用字符 Unicode 代码作为字形 ID,然后使用这个通用 cmap 名称而不填充实际 cmap,但这里不是这种情况。